<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>本地部署 on Kalend's Blog</title><link>https://blog.kalend.top/categories/%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2/</link><description>Recent content in 本地部署 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Thu, 23 Jul 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/categories/%E6%9C%AC%E5%9C%B0%E9%83%A8%E7%BD%B2/index.xml" rel="self" type="application/rss+xml"/><item><title>一张4090能跑GLM-5.2还是Qwen3-32B？国产大模型本地部署2026版</title><link>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</link><pubDate>Thu, 23 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</guid><description>&lt;p&gt;先说结论：4090 跑不了 GLM-5.2，Qwen3-30B-A3B 才是你的甜区。&lt;/p&gt;
&lt;p&gt;GLM-5.2 是 744B 参数的 MoE 模型，哪怕 2-bit 量化也要 238GB 显存，4090 的 24GB 连零头都不够。别折腾了，老老实实调 API。&lt;/p&gt;
&lt;p&gt;但 4090 并不是废物。2026 年国产大模型格局变了，MoE 架构让小显存也能跑大模型。一张 4090，能跑的东西比你想的多。&lt;/p&gt;
&lt;h2 id="4090-的-24gb-显存2026-年能跑什么"&gt;4090 的 24GB 显存，2026 年能跑什么？
&lt;/h2&gt;&lt;p&gt;2026 年国产大模型三足鼎立：DeepSeek V4、GLM-5.2、Qwen3。&lt;/p&gt;
&lt;p&gt;但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求上限&lt;/th&gt;
					&lt;th&gt;能跑的最大模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~12B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~24B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT4/Q4_K_M&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~48B（质量严重下降）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键点：MoE 模型虽然只激活部分参数，但推理时需要加载&lt;strong&gt;全部权重&lt;/strong&gt;到显存。30B 总参 / 3B 激活的 MoE，显存需求按 30B 算，不是 3B。&lt;/p&gt;
&lt;p&gt;所以 4090 的实际天花板是：&lt;strong&gt;32B INT4 或 30B MoE Q4_K_M&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="glm-52--744b-的看得到吃不到"&gt;GLM-5.2 — 744B 的&amp;quot;看得到吃不到&amp;quot;
&lt;/h2&gt;&lt;p&gt;GLM-5.2 是智谱 2026 年的旗舰模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~40B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，256 个专家（每个 token 激活 8+1 个）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit 量化显存&lt;/td&gt;
					&lt;td&gt;238GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit 量化显存&lt;/td&gt;
					&lt;td&gt;~372GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;即使是最激进的 2-bit 量化（质量已经很差），也需要 238GB 显存。4090 的 24GB 只有它的十分之一。&lt;/p&gt;
&lt;p&gt;这个模型适合什么硬件？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Mac Studio 256GB 统一内存&lt;/strong&gt;：勉强能跑 2-bit，速度慢但可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多卡服务器&lt;/strong&gt;：4×A100 80GB 或 8×4090，用张量并行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;云 GPU&lt;/strong&gt;：按小时租 A100/H100，适合偶尔用&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;4090 用户想用 GLM 系列，替代方案是：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;显存（FP16）&lt;/th&gt;
					&lt;th&gt;可用性&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B（推理增强）&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2 API&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
					&lt;td&gt;✅ 按 token 付费&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;说实话，GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力，调 API 是唯一现实选择。&lt;/p&gt;
&lt;h2 id="qwen3-30b-a3b--4090-的真正甜区"&gt;Qwen3-30B-A3B — 4090 的真正甜区
&lt;/h2&gt;&lt;p&gt;Qwen3 系列里，最适合 4090 的不是 Qwen3-32B，而是 Qwen3-30B-A3B。&lt;/p&gt;
&lt;p&gt;为什么？MoE 架构。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;Qwen3-30B-A3B&lt;/th&gt;
					&lt;th&gt;Qwen3-32B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;30B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;32B（全量）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
					&lt;td&gt;Dense&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M 显存&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理速度（4090）&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;综合能力&lt;/td&gt;
					&lt;td&gt;接近&lt;/td&gt;
					&lt;td&gt;略强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-30B-A3B 的核心优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;显存友好&lt;/strong&gt;：Q4_K_M 量化后只需 ~18GB，4090 还剩 6GB 给 KV Cache&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;速度快&lt;/strong&gt;：只激活 3B 参数做推理，速度是 Dense 32B 的 2-3 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力不差&lt;/strong&gt;：MoE 的 30B 总参保证了知识容量，3B 激活保证了速度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;实际推理速度（4090 + Ollama Q4_K_M）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输出速度&lt;/th&gt;
					&lt;th&gt;首 token 延迟&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~0.3s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
					&lt;td&gt;~0.8s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;~35 tok/s&lt;/td&gt;
					&lt;td&gt;~0.4s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;~65 tok/s&lt;/td&gt;
					&lt;td&gt;~0.2s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;30B-A3B 的速度接近 14B，但能力接近 32B。这就是 MoE 的魔力。&lt;/p&gt;
&lt;h2 id="4090-能跑的国产模型清单"&gt;4090 能跑的国产模型清单
&lt;/h2&gt;&lt;p&gt;以下是 2026 年 4090（24GB）实测可用的国产大模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求&lt;/th&gt;
					&lt;th&gt;推荐场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Qwen3-30B-A3B&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;30B/3B激活&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;⭐ 日常对话+编程&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;需要最高质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;~15GB&lt;/td&gt;
					&lt;td&gt;需INT8，平衡之选&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~16GB&lt;/td&gt;
					&lt;td&gt;轻量级，速度最快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1-32B（蒸馏）&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;INT4&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;推理/数学任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;GLM 生态兼容&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;推理增强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;场景推荐&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话&lt;/strong&gt;：Qwen3-30B-A3B（速度快、质量好）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;编程辅助&lt;/strong&gt;：Qwen3-30B-A3B 或 Qwen3-32B（代码能力 32B 更强）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数学/推理&lt;/strong&gt;：DeepSeek-R1-32B 蒸馏版（推理任务专项优化）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent/工具调用&lt;/strong&gt;：Qwen3-30B-A3B（速度快，适合多轮工具调用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM 生态&lt;/strong&gt;：GLM-Z1-9B（但能力有限，复杂任务建议 API）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="框架选择--ollama-vs-vllm-vs-sglang"&gt;框架选择 — Ollama vs vLLM vs SGLang
&lt;/h2&gt;&lt;p&gt;选完模型，还要选推理框架。三个主流选择：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;框架&lt;/th&gt;
					&lt;th&gt;优势&lt;/th&gt;
					&lt;th&gt;劣势&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;5分钟上手，一键安装&lt;/td&gt;
					&lt;td&gt;并发性能一般&lt;/td&gt;
					&lt;td&gt;个人使用、开发调试&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;高并发吞吐&lt;/td&gt;
					&lt;td&gt;配置复杂&lt;/td&gt;
					&lt;td&gt;服务化部署、多人共用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SGLang&lt;/td&gt;
					&lt;td&gt;Agent/工具调用优化&lt;/td&gt;
					&lt;td&gt;生态较小&lt;/td&gt;
					&lt;td&gt;AI Agent 开发&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Ollama（推荐大多数人）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 拉取模型（自动选 Q4_K_M）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 运行&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;5 分钟搞定，适合个人开发者。Ollama 会自动根据你的显存选择量化方案，不需要手动配置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;vLLM（需要高并发时）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;8192&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果你要给团队用，或者需要同时处理多个请求，vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGLang（Agent 开发专用）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install sglang
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m sglang.launch_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model-path Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;SGLang 对工具调用和结构化输出有专门优化，如果你在做 AI Agent 开发，值得试试。&lt;/p&gt;
&lt;h2 id="结论消费级显卡本地部署的理性预期"&gt;结论：消费级显卡本地部署的理性预期
&lt;/h2&gt;&lt;p&gt;一张 4090 能跑的国产大模型，比 2025 年多了不少，但别指望能跑旗舰。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得本地跑的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;日常对话、写作辅助（Qwen3-30B-A3B 足够）&lt;/li&gt;
&lt;li&gt;编程辅助（30B-A3B 或 32B，取决于代码复杂度）&lt;/li&gt;
&lt;li&gt;隐私敏感任务（不能把数据发到云端）&lt;/li&gt;
&lt;li&gt;高频调用（API 按 token 计费，高频场景本地更划算）&lt;/li&gt;
&lt;li&gt;学习和实验（理解模型推理过程）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;用 API 更划算的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要最强模型能力（GLM-5.2、DeepSeek V4 旗舰版）&lt;/li&gt;
&lt;li&gt;低频使用（偶尔用一次，不值得买显卡）&lt;/li&gt;
&lt;li&gt;多模态任务（图像、语音理解，本地模型支持有限）&lt;/li&gt;
&lt;li&gt;长上下文（本地模型上下文窗口通常 8K-32K，API 可以 128K+）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的现实是：MoE 架构让消费级显卡也能跑「够用」的大模型，但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合，别被 GLM-5.2 的参数量迷了眼。&lt;/p&gt;
&lt;p&gt;作者：varkm&lt;/p&gt;</description></item><item><title>Qwen 全家桶本地部署指南：从 0.6B 到 480B，你的显卡该跑哪个？</title><link>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</link><pubDate>Mon, 22 Jun 2026 10:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/06/22/2026-06-22-qwen-deploy-guide.html/</guid><description>&lt;p&gt;Qwen 是目前本地部署生态最完善的国产大模型。不管是 8GB 内存核显笔记本、4090 工作站，还是无显卡老机器，都有对应型号和量化方案。本文不说空话，直接按显卡预算给推荐。&lt;/p&gt;
&lt;p&gt;我测试了 Qwen3.5 全系列 + Ollama/vLLM 三种部署方式，对比了内存占用、首 token 延迟、生成速度，帮你找到最值的那款。&lt;/p&gt;
&lt;h2 id="qwen-模型家族全图景"&gt;Qwen 模型家族全图景
&lt;/h2&gt;&lt;p&gt;Qwen 在 2026 年形成完整矩阵：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数量&lt;/th&gt;
					&lt;th&gt;激活参数&lt;/th&gt;
					&lt;th&gt;显存需求（Q4）&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5&lt;/td&gt;
					&lt;td&gt;397B MoE (A17B)&lt;/td&gt;
					&lt;td&gt;17B&lt;/td&gt;
					&lt;td&gt;~200GB+&lt;/td&gt;
					&lt;td&gt;企业级、对标 GPT-4o&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-Coder&lt;/td&gt;
					&lt;td&gt;480B-A35B&lt;/td&gt;
					&lt;td&gt;35B&lt;/td&gt;
					&lt;td&gt;~240GB+&lt;/td&gt;
					&lt;td&gt;编程专用、多卡服务器部署&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;35B-A3B MoE&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;性价比甜点、推理快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;9B Dense&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;5.5GB&lt;/td&gt;
					&lt;td&gt;消费级显卡推荐起点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;4B Dense&lt;/td&gt;
					&lt;td&gt;4B&lt;/td&gt;
					&lt;td&gt;~2.5GB&lt;/td&gt;
					&lt;td&gt;核显笔记本可跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;2B Dense&lt;/td&gt;
					&lt;td&gt;2B&lt;/td&gt;
					&lt;td&gt;~1.2GB&lt;/td&gt;
					&lt;td&gt;老旧机器过渡&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.5-0.8B&lt;/td&gt;
					&lt;td&gt;0.8B Dense&lt;/td&gt;
					&lt;td&gt;0.8B&lt;/td&gt;
					&lt;td&gt;~0.5GB&lt;/td&gt;
					&lt;td&gt;无显卡纯 CPU&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;核心差异&lt;/strong&gt;：MoE（专家混合）vs Dense。MoE 模型（Qwen3.5、Qwen3-Coder）只激活部分参数，推理时等效于小模型，但需要更大的总显存来加载完整权重。Dense 模型（Qwen3.5-9B）所有参数都参与计算，显存占用低但推理慢。&lt;/p&gt;
&lt;h2 id="三种部署方式对比"&gt;三种部署方式对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;工具&lt;/th&gt;
					&lt;th&gt;安装难度&lt;/th&gt;
					&lt;th&gt;性能&lt;/th&gt;
					&lt;th&gt;适用平台&lt;/th&gt;
					&lt;th&gt;适合人群&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;一行命令&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;Linux/Mac/Windows&lt;/td&gt;
					&lt;td&gt;入门用户、日常使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;pip 安装&lt;/td&gt;
					&lt;td&gt;高（多卡并行）&lt;/td&gt;
					&lt;td&gt;Linux + GPU&lt;/td&gt;
					&lt;td&gt;API 服务、生产环境&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LM Studio/MLX&lt;/td&gt;
					&lt;td&gt;GUI&lt;/td&gt;
					&lt;td&gt;中等&lt;/td&gt;
					&lt;td&gt;macOS&lt;/td&gt;
					&lt;td&gt;Mac 用户首选&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;结论&lt;/strong&gt;：入门用 Ollama，生产用 vLLM。下文覆盖两者完整实战。&lt;/p&gt;
&lt;h2 id="实战一ollama-一键部署-qwen35-9b"&gt;实战一：Ollama 一键部署 Qwen3.5-9B
&lt;/h2&gt;&lt;p&gt;Ollama 是最简单的本地部署方式。以 Qwen3.5-9B 为例：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Ollama（Linux/macOS 一行搞定）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 拉取并运行 Qwen3.5-9B（首次自动下载 5.5GB 模型）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3.5:9b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;默认 Q4_K_M 量化，8GB RAM 可流畅运行。实测在 16GB RAM + RTX 3060（12GB）上：首 token 延迟约 0.8s，生成速度约 28 tok/s。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Modelfile 自定义&lt;/strong&gt;：调整上下文长度、温度：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;FROM&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s"&gt;qwen3.5:9b&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER num_ctx &lt;span class="m"&gt;32768&lt;/span&gt;&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER temperature 0.7&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;PARAMETER top_p 0.9&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;保存为 Modelfile，运行 &lt;code&gt;ollama create custom-qwen -f Modelfile &amp;amp;&amp;amp; ollama run custom-qwen&lt;/code&gt;。&lt;/p&gt;
&lt;h2 id="实战二vllm-部署-qwen36-35b-a3b"&gt;实战二：vLLM 部署 Qwen3.6-35B-A3B
&lt;/h2&gt;&lt;p&gt;Qwen3.6-35B-A3B 是性价比甜点：MoE 架构只激活 3B 参数，推理速度堪比 7B 模型，但需要约 18GB 显存加载完整权重。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;span class="lnt"&gt;11
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 vLLM（支持 CUDA）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 启动 vLLM 服务器（OpenAI 兼容 API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;1&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --dtype auto &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;32768&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --port &lt;span class="m"&gt;8000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;为什么用 AWQ 量化&lt;/strong&gt;：相比 GPTQ，AWQ 在 MoE 模型上的精度损失更小，且推理速度更快。&lt;/p&gt;
&lt;p&gt;实测在 RTX 4090（24GB）上：首 token 延迟约 0.4s，生成速度约 45 tok/s，相比 Ollama 有明显提升。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;OpenAI 兼容调用&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl http://localhost:8000/v1/chat/completions &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -H &lt;span class="s2"&gt;&amp;#34;Content-Type: application/json&amp;#34;&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; -d &lt;span class="s1"&gt;&amp;#39;{
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;model&amp;#34;: &amp;#34;Qwen/Qwen3.6-35B-A3B-Instruct&amp;#34;,
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;messages&amp;#34;: [{&amp;#34;role&amp;#34;: &amp;#34;user&amp;#34;, &amp;#34;content&amp;#34;: &amp;#34;写一个快速排序&amp;#34;}],
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; &amp;#34;temperature&amp;#34;: 0.7
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s1"&gt; }&amp;#39;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id="按显卡预算推荐配置"&gt;按显卡预算推荐配置
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;显卡&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;量化级别&lt;/th&gt;
					&lt;th&gt;预期性能&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;无显卡（8GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-2B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 2s，约 15 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;核显（16GB RAM）&lt;/td&gt;
					&lt;td&gt;Qwen3.5-4B&lt;/td&gt;
					&lt;td&gt;Q4&lt;/td&gt;
					&lt;td&gt;首 token 约 1.5s，约 20 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 3060 12GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;首 token 约 0.8s，约 28 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4070 Ti 16GB&lt;/td&gt;
					&lt;td&gt;Qwen3.5-9B&lt;/td&gt;
					&lt;td&gt;Q8_0&lt;/td&gt;
					&lt;td&gt;首 token 约 0.6s，约 35 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;RTX 4090 24GB&lt;/td&gt;
					&lt;td&gt;Qwen3.6-35B-A3B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.4s，约 45 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多卡服务器（240GB+）&lt;/td&gt;
					&lt;td&gt;Qwen3-Coder 480B&lt;/td&gt;
					&lt;td&gt;AWQ&lt;/td&gt;
					&lt;td&gt;首 token 约 0.3s，约 60 tok/s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;无显卡方案&lt;/strong&gt;：Ollama 会自动降级到 CPU 推理，速度慢但可用。临时测试跑大模型可上云 GPU（RunPod/Lambda Labs），按小时计费约 $0.5-1/h。&lt;/p&gt;
&lt;h2 id="进阶用-qwen3-coder-做-vibe-coding"&gt;进阶：用 Qwen3-Coder 做 Vibe Coding
&lt;/h2&gt;&lt;p&gt;本地 Qwen3-Coder + Claude Code CLI 或 OpenCode，可实现完整的 Vibe Coding 工作流：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 1. 安装 Qwen3-Coder（需要多卡或云 GPU）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3-coder:480b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 2. 配置 Claude Code 使用本地模型（需修改 Claude Code 配置指向 Ollama API）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 参考：https://claude.ai/code/docs&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 3. 实战体验&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 代码重构、测试生成：本地跑更划算&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 大规模代码库分析：云 GPU 快速完成&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# - 迭代调试：本地 9B 足够，频繁调用&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;对比 DeepSeek&lt;/strong&gt;：Qwen3-Coder 在编程任务上表现强劲，本地部署生态更完善。DeepSeek 最新开源 V3/R1 系列，在标准 NVIDIA GPU 上即可运行，但模型体积较大，本地部署门槛较高。&lt;/p&gt;
&lt;h2 id="踩坑指南常见问题和解决方案"&gt;踩坑指南：常见问题和解决方案
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;问题 1：显存不足 OOM&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;vLLM 启动时如果报 &lt;code&gt;CUDA out of memory&lt;/code&gt;，尝试：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt; 1
&lt;/span&gt;&lt;span class="lnt"&gt; 2
&lt;/span&gt;&lt;span class="lnt"&gt; 3
&lt;/span&gt;&lt;span class="lnt"&gt; 4
&lt;/span&gt;&lt;span class="lnt"&gt; 5
&lt;/span&gt;&lt;span class="lnt"&gt; 6
&lt;/span&gt;&lt;span class="lnt"&gt; 7
&lt;/span&gt;&lt;span class="lnt"&gt; 8
&lt;/span&gt;&lt;span class="lnt"&gt; 9
&lt;/span&gt;&lt;span class="lnt"&gt;10
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案一：增加 tensor-parallel-size 分摊到多卡&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --tensor-parallel-size &lt;span class="m"&gt;2&lt;/span&gt; &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 方案二：换更激进的量化级别（awq → gptq，显存省约 10%）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3.6-35B-A3B-Instruct &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization gptq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 2：中文输出质量差&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Ollama 默认英文 prompt 优先，在 Modelfile 中强制中文：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-dockerfile" data-lang="dockerfile"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;SYSTEM 你是一个中文助手，请用中文回答所有问题。&lt;span class="err"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;问题 3：量化精度损失&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Qwen3.5-9B Q4_K_M 在中文理解上基本无损，但复杂逻辑推理可能出错。对精度要求高的任务（数学证明、代码审查），推荐 Q8_0 或 FP16。&lt;/p&gt;
&lt;h2 id="结论一张决策表搞定"&gt;结论：一张决策表搞定
&lt;/h2&gt;&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算充足（240GB+） → Qwen3-Coder 480B → vLLM + 多卡并行
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;单卡旗舰（24GB） → Qwen3.6-35B-A3B → vLLM + AWQ 量化
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;消费级推荐（12GB） → Qwen3.5-9B → Ollama Q4_K_M
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;预算紧张（核显） → Qwen3.5-4B → Ollama CPU 推理
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;临时测试 → 云 GPU → 按小时计费
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;核心原则：&lt;strong&gt;先确定显卡预算，再选对应模型和量化级别&lt;/strong&gt;。MoE 模型适合显卡充足的用户（推理快），Dense 模型适合预算有限的用户（显存占用低）。&lt;/p&gt;</description></item></channel></rss>