<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Qwen on Kalend's Blog</title><link>https://blog.kalend.top/tags/qwen/</link><description>Recent content in Qwen on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Mon, 22 Jun 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/qwen/index.xml" rel="self" type="application/rss+xml"/><item><title>Qwen 全家桶本地部署指南：从 0.6B 到 480B，你的显卡该跑哪个？</title><link>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</link><pubDate>Mon, 22 Jun 2026 10:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</guid><description>&lt;p&gt;Qwen 是目前本地部署生态最完善的国产大模型。不管是 8GB 内存核显笔记本、4090 工作站，还是无显卡老机器，都有对应型号和量化方案。本文不说空话，直接按显卡预算给推荐。&lt;/p&gt;
&lt;p&gt;我测试了 Qwen3.5 全系列 + Ollama/vLLM 三种部署方式，对比了内存占用、首 token 延迟、生成速度，帮你找到最值的那款。&lt;/p&gt;
&lt;h2 id="qwen-模型家族全图景"&gt;Qwen 模型家族全图景
&lt;/h2&gt;&lt;p&gt;Qwen 在 2026 年形成完整矩阵：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;激活参数&lt;/th&gt;
					&lt;th&gt;显存需求（Q4）&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5&lt;/td&gt;
					&lt;td&gt;397B MoE (A17B)&lt;/td&gt;
					&lt;td&gt;17B&lt;/td&gt;
					&lt;td&gt;~200GB+&lt;/td&gt;
					&lt;td&gt;企业级、对标 GPT-4o&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-Coder&lt;/td&gt;
					&lt;td&gt;480B-A35B&lt;/td&gt;
					&lt;td&gt;35B&lt;/td&gt;
					&lt;td&gt;~240GB+&lt;/td&gt;
					&lt;td&gt;编程专用、多卡服务器部署&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;35B-A3B MoE&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;性价比甜点、推理快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;9B Dense&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;消费级显卡推荐起点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;4B Dense&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;~2.5GB&lt;/td&gt;
					&lt;td&gt;核显笔记本可跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;2B Dense&lt;/td&gt;
					&lt;td&gt;2B&lt;/td&gt;
					&lt;td&gt;~1.2GB&lt;/td&gt;
					&lt;td&gt;老旧机器过渡&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-0.8B&lt;/td&gt;
					&lt;td&gt;0.8B Dense&lt;/td&gt;
					&lt;td&gt;0.8B&lt;/td&gt;
					&lt;td&gt;~0.5GB&lt;/td&gt;
					&lt;td&gt;无显卡纯 CPU&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;核心差异&lt;/strong&gt;：MoE（专家混合）vs Dense。MoE 模型（Qwen3.5、Qwen3-Coder）只激活部分参数，推理时等效于小模型，但需要更大的总显存来加载完整权重。Dense 模型（Qwen3.5-9B）所有参数都参与计算，显存占用低但推理慢。&lt;/p&gt;
&lt;h2 id="三种部署方式对比"&gt;三种部署方式对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;工具&lt;/th&gt;
					&lt;th&gt;安装难度&lt;/th&gt;
					&lt;th&gt;性能&lt;/th&gt;
					&lt;th&gt;适用平台&lt;/th&gt;
					&lt;th&gt;适合人群&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;一行命令&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;Linux/Mac/Windows&lt;/td&gt;
					&lt;td&gt;入门用户、日常使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;pip 安装&lt;/td&gt;
					&lt;td&gt;高（多卡并行）&lt;/td&gt;
					&lt;td&gt;Linux + GPU&lt;/td&gt;
					&lt;td&gt;API 服务、生产环境&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LM Studio/MLX&lt;/td&gt;
					&lt;td&gt;GUI&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;macOS&lt;/td&gt;
					&lt;td&gt;Mac 用户首选&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;结论&lt;/strong&gt;：入门用 Ollama，生产用 vLLM。下文覆盖两者完整实战。&lt;/p&gt;
&lt;h2 id="实战一ollama-一键部署-qwen35-9b"&gt;实战一：Ollama 一键部署 Qwen3.5-9B
&lt;/h2&gt;&lt;p&gt;Ollama 是最简单的本地部署方式。以 Qwen3.5-9B 为例：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Ollama（Linux/macOS 一行搞定）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 拉取并运行 Qwen3.5-9B（首次自动下载 5.5GB 模型）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3.5:9b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;默认 Q4_K_M 量化，8GB RAM 可流畅运行。实测在 16GB RAM + RTX 3060（12GB）上：首 token 延迟约 0.8s，生成速度约 28 tok/s。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Modelfile 自定义&lt;/strong&gt;：调整上下文长度、温度：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;FROM&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s"&gt;qwen3.5:9b&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER num_ctx &lt;span class="m"&gt;32768&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER temperature 0.7&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER top_p 0.9&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;保存为 Modelfile，运行 &lt;code&gt;ollama create custom-qwen -f Modelfile &amp;amp;&amp;amp; ollama run custom-qwen&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="实战二vllm-部署-qwen36-35b-a3b"&gt;实战二：vLLM 部署 Qwen3.6-35B-A3B
&lt;/h2&gt;&lt;p&gt;Qwen3.6-35B-A3B 是性价比甜点：MoE 架构只激活 3B 参数，推理速度堪比 7B 模型，但需要约 18GB 显存加载完整权重。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 vLLM（支持 CUDA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 启动 vLLM 服务器（OpenAI 兼容 API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;1&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --dtype auto &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;32768&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --port &lt;span class="m"&gt;8000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;为什么用 AWQ 量化&lt;/strong&gt;：相比 GPTQ，AWQ 在 MoE 模型上的精度损失更小，且推理速度更快。&lt;/p&gt;
&lt;p&gt;实测在 RTX 4090（24GB）上：首 token 延迟约 0.4s，生成速度约 45 tok/s，相比 Ollama 有明显提升。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;OpenAI 兼容调用&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl http://localhost:8000/v1/chat/completions &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -H &lt;span class="s2"&gt;&amp;#34;Content-Type: application/json&amp;#34;&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -d &lt;span class="s1"&gt;&amp;#39;{
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;model&amp;#34;: &amp;#34;Qwen/Qwen3.6-35B-A3B-Instruct&amp;#34;,
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;messages&amp;#34;: [{&amp;#34;role&amp;#34;: &amp;#34;user&amp;#34;, &amp;#34;content&amp;#34;: &amp;#34;写一个快速排序&amp;#34;}],
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;temperature&amp;#34;: 0.7
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; }&amp;#39;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="按显卡预算推荐配置"&gt;按显卡预算推荐配置
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;显卡&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;预期性能&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;无显卡（8GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 2s，约 15 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;核显（16GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 1.5s，约 20 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 3060 12GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;首 token 约 0.8s，约 28 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4070 Ti 16GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;首 token 约 0.6s，约 35 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4090 24GB&lt;/td&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.4s，约 45 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多卡服务器（240GB+）&lt;/td&gt;
					&lt;td&gt;Qwen3-Coder 480B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.3s，约 60 tok/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;无显卡方案&lt;/strong&gt;：Ollama 会自动降级到 CPU 推理，速度慢但可用。临时测试跑大模型可上云 GPU（RunPod/Lambda Labs），按小时计费约 $0.5-1/h。&lt;/p&gt;
&lt;h2 id="进阶用-qwen3-coder-做-vibe-coding"&gt;进阶：用 Qwen3-Coder 做 Vibe Coding
&lt;/h2&gt;&lt;p&gt;本地 Qwen3-Coder + Claude Code CLI 或 OpenCode，可实现完整的 Vibe Coding 工作流：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Qwen3-Coder（需要多卡或云 GPU）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3-coder:480b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 配置 Claude Code 使用本地模型（需修改 Claude Code 配置指向 Ollama API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 参考：https://claude.ai/code/docs&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 3. 实战体验&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 代码重构、测试生成：本地跑更划算&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 大规模代码库分析：云 GPU 快速完成&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 迭代调试：本地 9B 足够，频繁调用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;对比 DeepSeek&lt;/strong&gt;：Qwen3-Coder 在编程任务上表现强劲，本地部署生态更完善。DeepSeek 最新开源 V3/R1 系列，在标准 NVIDIA GPU 上即可运行，但模型体积较大，本地部署门槛较高。&lt;/p&gt;
&lt;h2 id="踩坑指南常见问题和解决方案"&gt;踩坑指南：常见问题和解决方案
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;问题 1：显存不足 OOM&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;vLLM 启动时如果报 &lt;code&gt;CUDA out of memory&lt;/code&gt;，尝试：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案一：增加 tensor-parallel-size 分摊到多卡&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;2&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案二：换更激进的量化级别（awq → gptq，显存省约 10%）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization gptq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 2：中文输出质量差&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Ollama 默认英文 prompt 优先，在 Modelfile 中强制中文：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;SYSTEM 你是一个中文助手，请用中文回答所有问题。&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 3：量化精度损失&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Qwen3.5-9B Q4_K_M 在中文理解上基本无损，但复杂逻辑推理可能出错。对精度要求高的任务（数学证明、代码审查），推荐 Q8_0 或 FP16。&lt;/p&gt;
&lt;h2 id="结论一张决策表搞定"&gt;结论：一张决策表搞定
&lt;/h2&gt;&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算充足（240GB+） → Qwen3-Coder 480B → vLLM + 多卡并行
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;单卡旗舰（24GB） → Qwen3.6-35B-A3B → vLLM + AWQ 量化
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;消费级推荐（12GB） → Qwen3.5-9B → Ollama Q4_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算紧张（核显） → Qwen3.5-4B → Ollama CPU 推理
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;临时测试 → 云 GPU → 按小时计费
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;核心原则：&lt;strong&gt;先确定显卡预算，再选对应模型和量化级别&lt;/strong&gt;。MoE 模型适合显卡充足的用户（推理快），Dense 模型适合预算有限的用户（显存占用低）。&lt;/p&gt;</description></item><item><title>你的显卡到底该跑哪个：国产大模型本地部署横向实测</title><link>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</link><pubDate>Mon, 15 Jun 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/15/2026-06-15-%E5%9B%BD%E4%BA%A7%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2%E6%A8%AA%E5%90%91%E5%AE%9E%E6%B5%8B.html/</guid><description>&lt;p&gt;先给结论：没有&amp;quot;最强&amp;quot;，只有&amp;quot;最合适&amp;quot;。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;你的显存&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;预期速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;8GB&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文万金油）&lt;/td&gt;
					&lt;td&gt;100+ tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;12GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b（推理强）&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;16GB&lt;/td&gt;
					&lt;td&gt;Qwen3:14b 或 DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;70-120 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b 蒸馏版&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是我在 RTX 3060 12GB 和 RTX 4090 24GB 上跑了两个星期、测试了十几个模型后得出的真实结论。下面展开说。&lt;/p&gt;
&lt;h2 id="一为什么是-deepseekqwenglm-这三家"&gt;一、为什么是 DeepSeek、Qwen、GLM 这三家
&lt;/h2&gt;&lt;p&gt;国产开源大模型不少，但真正在 Ollama 上能跑、社区支持成熟、中文效果好的，就这三家：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;DeepSeek（深度求索）&lt;/strong&gt;：推理、数学、代码领域的王者。采用 MoE（混合专家）架构，满血版 DeepSeek V4 Pro 有 861B 参数——但那是云端模型，本地根本跑不了。我们本地能用的是 R1 蒸馏系列：把满血模型的推理能力&amp;quot;蒸馏&amp;quot;进 1.5B 到 32B 的小模型里，性能远超同参数量的普通模型。DeepSeek V4 Flash 版 158B 参数的 API 调用价格仅 0.28 美元/百万 token，是目前性价比最高的云端模型之一。但本地部署用 R1 蒸馏版，7B 仅需 4.7GB 显存，效果已经非常能打。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Qwen（通义千问）&lt;/strong&gt;：多语言能力最强，支持 119 种语言，中文效果极佳。最大优势是覆盖全：从 0.6B 到 235B 全系覆盖，树莓派上都能跑 4B 版本。生态最完善，量化版本最丰富。在 RTX 4090 上实测，Qwen3:0.6b 推理速度达 280 tokens/s，4b 也有 107 tokens/s，8b 为 69 tokens/s——速度表现是三家里最快的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;GLM（智谱）&lt;/strong&gt;：中英双语专精，长文本（32K 上下文）处理能力强，GLM-5.1 满血版 753B 参数也是云端模型。本地能跑的是 GLM-4:9b，5.5GB Q4 量化即可运行。在长文本摘要、中英翻译、专业文档分析场景下，GLM-4 的表现超出其参数量预期。&lt;/p&gt;
&lt;p&gt;为什么不用 Llama 或 Mistral？两个原因：中文支持弱，而且它们不是国产。这篇文章就是写给想用国产模型的人。&lt;/p&gt;
&lt;h2 id="二5-分钟装好-ollama"&gt;二、5 分钟装好 Ollama
&lt;/h2&gt;&lt;p&gt;Ollama 是目前最简单的本地大模型运行工具。三平台一行命令：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# macOS / Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 官网下载 OllamaSetup.exe，双击安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;装完验证：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama --version
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 应显示版本号，无 Warning&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;第一个坑：默认装在 C 盘。&lt;/strong&gt; Windows 用户装完会发现模型默认存在 &lt;code&gt;C:\Users\你的用户名\.ollama\models&lt;/code&gt;，几十 GB 很快吃满系统盘。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 设置环境变量后重启 Ollama 服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 系统环境变量添加 OLLAMA_MODELS=D:\ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Linux: export OLLAMA_MODELS=/data/ollama-models&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;ollama pull 和 ollama run 的区别&lt;/strong&gt;：&lt;code&gt;pull&lt;/code&gt; 只下载不启动，&lt;code&gt;run&lt;/code&gt; 下载后直接进入对话。第一次用建议先 &lt;code&gt;pull&lt;/code&gt;，确认下载完成再 &lt;code&gt;run&lt;/code&gt;，避免网络中断导致模型损坏。下载支持断点续传——如果中途断了，重新执行 &lt;code&gt;ollama pull&lt;/code&gt; 会从断点继续，不需要从头来。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;下载速度提示&lt;/strong&gt;：Ollama 的模型仓库（registry）在国内网络环境下直连速度约 4-5MB/s，第一次下载大模型需要耐心。不要中途 Ctrl+C，让它跑完。&lt;/p&gt;
&lt;h2 id="三显存分级选型指南核心章节"&gt;三、显存分级选型指南（核心章节）
&lt;/h2&gt;&lt;p&gt;本地部署最重要的决策：你的显存能跑什么？这里有一个公式：&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;显存需求 ≈ 参数量(B) × 量化系数 + KV缓存开销&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;Q4_K_M（4-bit 量化）的系数约为 0.7。以 7B 模型为例：7 × 0.7 ≈ 4.9GB 模型本体，加上上下文缓存，实际需要 6-7GB 显存。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;必须知道的事实：Ollama 的显存占用比 vLLM 多约 30-40%&lt;/strong&gt;，因为 Ollama 底层封装了 llama.cpp，有额外的运行时开销。同样的模型，vLLM 可能用 5GB，Ollama 要 7GB。这是易用性的代价。&lt;/p&gt;
&lt;h3 id="第一档集成显卡--8gb-内存贫民窟"&gt;第一档：集成显卡 / 8GB 内存（贫民窟）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:1.7b 或 Qwen3:0.6b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;1.4GB（0.6b）/ 2.5GB（1.7b Q4）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;20-40 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;简单问答、文本摘要、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;代码生成、复杂推理、长文本分析&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这个档位别指望太多，能跑起来就是胜利。&lt;/p&gt;
&lt;h3 id="第二档6-8gb-独立显卡"&gt;第二档：6-8GB 独立显卡
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;Qwen3:4b（中文首选）、DeepSeek-R1:1.5b（推理入门）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;2.5GB（Qwen3:4b Q4）/ 1.1GB（R1:1.5b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-107 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;日常对话、文案写作、简单代码、翻译&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;复杂算法题、大型代码重构&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3:4b 实测可以跑到 107 tokens/s，日常使用完全够用。这是我推荐的&amp;quot;万金油&amp;quot;选择。&lt;/p&gt;
&lt;h3 id="第三档12-16gb-显存甜点区"&gt;第三档：12-16GB 显存（甜点区）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:7b、Qwen3:8b、GLM-4:9b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;4.7GB / 5.2GB / 5.5GB（均为 Q4_K_M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;40-70 tokens/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;中等难度代码、数学推理、长文写作、多轮对话&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;70B 级别的复杂推理&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;这是性价比最高的档位。DeepSeek-R1:7b 在 RTX 3060 12GB 上流畅推理，4.7GB 模型占用加 2GB 上下文缓存，总共不到 7GB，还有余量。&lt;/p&gt;
&lt;h3 id="第四档24gb-显存"&gt;第四档：24GB 显存
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;推荐模型&lt;/td&gt;
					&lt;td&gt;DeepSeek-R1:32b、Qwen3:14b&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型大小&lt;/td&gt;
					&lt;td&gt;20GB（R1:32b）/ 9.3GB（Qwen3:14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预期速度&lt;/td&gt;
					&lt;td&gt;30-60 tokens/s（32b）/ 70-120 tokens/s（14b）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;能干什么&lt;/td&gt;
					&lt;td&gt;高质量代码生成、复杂推理、专业领域分析&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不能干什么&lt;/td&gt;
					&lt;td&gt;满血 671B 模型（需要 400GB+ 显存）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;到了这个档位，R1:32b 的推理能力已经接近 GPT-4 水平，32B 蒸馏版是本地能跑的最大 R1 模型。&lt;/p&gt;
&lt;h2 id="四三模型实测对比"&gt;四、三模型实测对比
&lt;/h2&gt;&lt;p&gt;以下数据基于 RTX 4090 24GB，同一硬件、同一 prompt 的横向对比：&lt;/p&gt;
&lt;h3 id="推理速度tokensq4_k_m-量化"&gt;推理速度（token/s，Q4_K_M 量化）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;模型大小&lt;/th&gt;
					&lt;th&gt;推理速度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:4b&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;2.5GB&lt;/td&gt;
					&lt;td&gt;107 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:8b&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;5.2GB&lt;/td&gt;
					&lt;td&gt;69 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:7b&lt;/td&gt;
					&lt;td&gt;7B&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;55 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4:9b&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;48 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1:14b&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;9.0GB&lt;/td&gt;
					&lt;td&gt;35 t/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3:32b&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;20GB&lt;/td&gt;
					&lt;td&gt;22 t/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;速度跟参数量基本呈反比。但 DeepSeek-R1 系列因为推理时会输出思考过程，实际等待时间比纯速度数字更长。&lt;/p&gt;
&lt;h3 id="中文理解质量"&gt;中文理解质量
&lt;/h3&gt;&lt;p&gt;同一道题：&amp;ldquo;请解释量子纠缠，用小学生能听懂的话。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Qwen3&lt;/strong&gt;：比喻贴切，用词自然，最像真人说话。中文确实是强项。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4&lt;/strong&gt;：准确但偏书面，有点像教科书。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1&lt;/strong&gt;：先在思考链里推理了 200 多个 token，然后给出答案。答案质量最高，但等待时间长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="代码生成"&gt;代码生成
&lt;/h3&gt;&lt;p&gt;同一题：&amp;ldquo;用 Python 写一个快速排序，加注释。&amp;rdquo;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：代码正确，注释详细，还主动给出了测试用例。推理过程耗时约 8 秒（包含思考链），但最终输出质量最高。这正是 R1 蒸馏的优势——推理能力被完整保留。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：代码正确，注释简洁，3 秒出结果。日常使用完全够用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：代码正确，但格式略乱，缩进有不一致的地方。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="长文本处理"&gt;长文本处理
&lt;/h3&gt;&lt;p&gt;输入一篇 3000 字的技术文章，要求总结要点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;GLM-4:9b&lt;/strong&gt;：32K 上下文窗口的优势在这里体现，要点提取最完整，逻辑清晰。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Qwen3:8b&lt;/strong&gt;：摘要质量不错，但遗漏了一些次要要点。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek-R1:7b&lt;/strong&gt;：会先在思考链里梳理全文结构再输出，总结最深入，但耗时最长。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="如果只能装一个选谁"&gt;如果只能装一个，选谁？
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话 + 中文场景&lt;/strong&gt; → Qwen3:8b（速度和质量的最佳平衡）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;写代码 + 数学推理&lt;/strong&gt; → DeepSeek-R1:7b（推理质量碾压同级别）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;长文档分析&lt;/strong&gt; → GLM-4:9b（32K 上下文窗口最大）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我的建议：先装 Qwen3:8b，用顺了再根据需求加装其他模型。Ollama 切换模型只需 &lt;code&gt;ollama run 模型名&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="五量化怎么选不踩坑"&gt;五、量化怎么选不踩坑
&lt;/h2&gt;&lt;p&gt;Ollama 默认下载的就是 Q4_K_M（4-bit）量化版本。但 Ollama 也支持其他量化级别：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;每参数比特&lt;/th&gt;
					&lt;th&gt;7B 模型大小&lt;/th&gt;
					&lt;th&gt;质量损失&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~4.5 bit&lt;/td&gt;
					&lt;td&gt;4.7GB&lt;/td&gt;
					&lt;td&gt;约 5%&lt;/td&gt;
					&lt;td&gt;性价比之王，默认选择&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q5_K_M&lt;/td&gt;
					&lt;td&gt;~5.5 bit&lt;/td&gt;
					&lt;td&gt;5.7GB&lt;/td&gt;
					&lt;td&gt;约 2%&lt;/td&gt;
					&lt;td&gt;显存够就升级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;8 bit&lt;/td&gt;
					&lt;td&gt;7.0GB&lt;/td&gt;
					&lt;td&gt;几乎无&lt;/td&gt;
					&lt;td&gt;追求极致质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;F16&lt;/td&gt;
					&lt;td&gt;16 bit&lt;/td&gt;
					&lt;td&gt;14GB&lt;/td&gt;
					&lt;td&gt;无损&lt;/td&gt;
					&lt;td&gt;调试/对比基准&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Q4_K_M 为什么是性价王？&lt;/strong&gt; 因为它把模型压缩到原来的 30%，但质量只损失 5%。对绝大多数日常使用场景，你根本感受不到差别。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;量化的&amp;quot;看不见的代价&amp;quot;&lt;/strong&gt;：在简单任务上（翻译、摘要）几乎无感，但在复杂推理任务上（多步数学推导、长链代码逻辑），Q4 相比 F16 的差距会被放大。如果你用模型做复杂推理，建议上 Q5_K_M 或 Q8_0。&lt;/p&gt;
&lt;p&gt;手动指定量化版本：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q5_K_M 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:8b-q5_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 下载 Q8 版本&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull deepseek-r1:7b-q8_0
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="六常见踩坑与排障"&gt;六、常见踩坑与排障
&lt;/h2&gt;&lt;h3 id="坑-1oom-崩溃"&gt;坑 1：OOM 崩溃
&lt;/h3&gt;&lt;p&gt;报错 &lt;code&gt;CUDA out of memory&lt;/code&gt; 或程序直接闪退。先判断是显存不够还是内存不够：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看显存使用（NVIDIA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;nvidia-smi
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 查看内存使用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;free -h &lt;span class="c1"&gt;# Linux&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Windows: 任务管理器 → 性能 → 内存&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果 &lt;code&gt;nvidia-smi&lt;/code&gt; 显示显存占用 95%+，说明模型太大，换小一号。如果内存也快满了，说明上下文太长，减小 &lt;code&gt;num_ctx&lt;/code&gt; 参数。&lt;/p&gt;
&lt;h3 id="坑-2选了-70b-发现-16gb-根本跑不起来"&gt;坑 2：选了 70B 发现 16GB 根本跑不起来
&lt;/h3&gt;&lt;p&gt;这是一个常见误区：参数越大越好。70B 模型 Q4 量化后需要 43GB 显存，RTX 4090 24GB 都扛不住。它会自动降速到 CPU 推理，速度从 50 tokens/s 暴跌到 2 tokens/s，基本不可用。&lt;/p&gt;
&lt;p&gt;我见过太多人下载了 deepseek-r1:671b（404GB），等了半天下载完，跑起来一个字要等 10 秒。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;记住：选模型的第一标准是你的显存，不是&amp;quot;越大越好&amp;quot;。&lt;/strong&gt; 参数量翻倍，推理能力提升可能只有 10-15%，但显存需求翻倍，速度腰斩。32B 蒸馏版已经能覆盖绝大多数使用场景。&lt;/p&gt;
&lt;h3 id="坑-3中文输出乱码或英文-fallback"&gt;坑 3：中文输出乱码或英文 fallback
&lt;/h3&gt;&lt;p&gt;部分模型在上下文较短时会混入英文回答。解决方法：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 在 Modelfile 里设置系统提示&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama create my-qwen -f - &lt;span class="s"&gt;&amp;lt;&amp;lt; &amp;#39;EOF&amp;#39;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;FROM qwen3:8b
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;SYSTEM &amp;#34;你是一个中文助手，请始终用中文回答。&amp;#34;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;EOF&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id="坑-4速度优化"&gt;坑 4：速度优化
&lt;/h3&gt;&lt;p&gt;三个有效的优化手段：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;确保 GPU offload 开启&lt;/strong&gt;：Ollama 默认自动 offload，但如果你的 CUDA 驱动版本不对，会静默回退到 CPU。检查 &lt;code&gt;nvidia-smi&lt;/code&gt; 在推理时是否有显存占用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;控制上下文长度&lt;/strong&gt;：默认 2048 token，长对话会吃掉大量 KV 缓存显存。如果不需要长上下文，别开太大。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;别同时加载多个模型&lt;/strong&gt;：Ollama 默认 5 分钟后卸载空闲模型，但如果频繁切换，多个模型同时驻留显存会导致 OOM。&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 id="关于-ollama-的安全通报"&gt;关于 Ollama 的安全通报
&lt;/h3&gt;&lt;p&gt;2025 年 Ollama 曾出现在国家网络漏洞通报中（CVE 评估），主要涉及本地 API 端口暴露问题。Ollama 默认监听 &lt;code&gt;127.0.0.1:11434&lt;/code&gt;，只要不手动改成 &lt;code&gt;0.0.0.0&lt;/code&gt; 暴露到公网，风险可控。如果你需要远程访问，建议用 SSH 隧道而非直接暴露端口。&lt;/p&gt;
&lt;h2 id="七进阶接进你的代码"&gt;七、进阶——接进你的代码
&lt;/h2&gt;&lt;p&gt;本地部署的模型如果只是命令行聊天，那就是个高级玩具。真正有用的是接进你的工作流。&lt;/p&gt;
&lt;p&gt;Ollama 提供 OpenAI 兼容 API，一行代码就能调用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;span class="lnt"&gt;12
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="nn"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;ollama&amp;#34;&lt;/span&gt; &lt;span class="c1"&gt;# 随便填，本地不需要认证&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;role&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;user&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;content&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;用一句话解释什么是递归&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;这意味着什么？所有支持 OpenAI API 的工具——代码编辑器插件、知识库系统、自动化脚本——只要把 API 地址从 &lt;code&gt;api.openai.com&lt;/code&gt; 改成 &lt;code&gt;localhost:11434&lt;/code&gt;，就能用本地模型替代付费 API。&lt;/p&gt;
&lt;p&gt;比如在 VS Code 的 Continue 插件里配置本地模型：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;models&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;title&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;Local Qwen3&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;provider&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;openai&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;model&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;qwen3:8b&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;apiBase&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;http://localhost:11434/v1&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;零成本、零延迟、数据不出本机。这才是本地部署的意义——不是把模型装上就完事，而是把它变成你日常工具链的一部分。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;以上就是全部内容。总结一下：8GB 装 Qwen3:4b，12GB 装 DeepSeek-R1:7b，16GB 以上看需求选 14b 级别。量化用默认 Q4_K_M 就行。装完记得接进代码里用起来，别让它吃灰。&lt;/p&gt;</description></item></channel></rss>