<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>量化 on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E9%87%8F%E5%8C%96/</link><description>Recent content in 量化 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Thu, 23 Jul 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E9%87%8F%E5%8C%96/index.xml" rel="self" type="application/rss+xml"/><item><title>一张4090能跑GLM-5.2还是Qwen3-32B？国产大模型本地部署2026版</title><link>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</link><pubDate>Thu, 23 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</guid><description>&lt;p&gt;先说结论：4090 跑不了 GLM-5.2，Qwen3-30B-A3B 才是你的甜区。&lt;/p&gt;
&lt;p&gt;GLM-5.2 是 744B 参数的 MoE 模型，哪怕 2-bit 量化也要 238GB 显存，4090 的 24GB 连零头都不够。别折腾了，老老实实调 API。&lt;/p&gt;
&lt;p&gt;但 4090 并不是废物。2026 年国产大模型格局变了，MoE 架构让小显存也能跑大模型。一张 4090，能跑的东西比你想的多。&lt;/p&gt;
&lt;h2 id="4090-的-24gb-显存2026-年能跑什么"&gt;4090 的 24GB 显存，2026 年能跑什么？
&lt;/h2&gt;&lt;p&gt;2026 年国产大模型三足鼎立：DeepSeek V4、GLM-5.2、Qwen3。&lt;/p&gt;
&lt;p&gt;但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求上限&lt;/th&gt;
					&lt;th&gt;能跑的最大模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~12B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~24B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT4/Q4_K_M&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~48B（质量严重下降）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键点：MoE 模型虽然只激活部分参数，但推理时需要加载&lt;strong&gt;全部权重&lt;/strong&gt;到显存。30B 总参 / 3B 激活的 MoE，显存需求按 30B 算，不是 3B。&lt;/p&gt;
&lt;p&gt;所以 4090 的实际天花板是：&lt;strong&gt;32B INT4 或 30B MoE Q4_K_M&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="glm-52--744b-的看得到吃不到"&gt;GLM-5.2 — 744B 的&amp;quot;看得到吃不到&amp;quot;
&lt;/h2&gt;&lt;p&gt;GLM-5.2 是智谱 2026 年的旗舰模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~40B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，256 个专家（每个 token 激活 8+1 个）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit 量化显存&lt;/td&gt;
					&lt;td&gt;238GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit 量化显存&lt;/td&gt;
					&lt;td&gt;~372GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;即使是最激进的 2-bit 量化（质量已经很差），也需要 238GB 显存。4090 的 24GB 只有它的十分之一。&lt;/p&gt;
&lt;p&gt;这个模型适合什么硬件？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Mac Studio 256GB 统一内存&lt;/strong&gt;：勉强能跑 2-bit，速度慢但可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多卡服务器&lt;/strong&gt;：4×A100 80GB 或 8×4090，用张量并行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;云 GPU&lt;/strong&gt;：按小时租 A100/H100，适合偶尔用&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;4090 用户想用 GLM 系列，替代方案是：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;显存（FP16）&lt;/th&gt;
					&lt;th&gt;可用性&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B（推理增强）&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2 API&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
					&lt;td&gt;✅ 按 token 付费&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;说实话，GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力，调 API 是唯一现实选择。&lt;/p&gt;
&lt;h2 id="qwen3-30b-a3b--4090-的真正甜区"&gt;Qwen3-30B-A3B — 4090 的真正甜区
&lt;/h2&gt;&lt;p&gt;Qwen3 系列里，最适合 4090 的不是 Qwen3-32B，而是 Qwen3-30B-A3B。&lt;/p&gt;
&lt;p&gt;为什么？MoE 架构。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;Qwen3-30B-A3B&lt;/th&gt;
					&lt;th&gt;Qwen3-32B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;30B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;32B（全量）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
					&lt;td&gt;Dense&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M 显存&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理速度（4090）&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;综合能力&lt;/td&gt;
					&lt;td&gt;接近&lt;/td&gt;
					&lt;td&gt;略强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-30B-A3B 的核心优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;显存友好&lt;/strong&gt;：Q4_K_M 量化后只需 ~18GB，4090 还剩 6GB 给 KV Cache&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;速度快&lt;/strong&gt;：只激活 3B 参数做推理，速度是 Dense 32B 的 2-3 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力不差&lt;/strong&gt;：MoE 的 30B 总参保证了知识容量，3B 激活保证了速度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;实际推理速度（4090 + Ollama Q4_K_M）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输出速度&lt;/th&gt;
					&lt;th&gt;首 token 延迟&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~0.3s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
					&lt;td&gt;~0.8s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;~35 tok/s&lt;/td&gt;
					&lt;td&gt;~0.4s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;~65 tok/s&lt;/td&gt;
					&lt;td&gt;~0.2s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;30B-A3B 的速度接近 14B，但能力接近 32B。这就是 MoE 的魔力。&lt;/p&gt;
&lt;h2 id="4090-能跑的国产模型清单"&gt;4090 能跑的国产模型清单
&lt;/h2&gt;&lt;p&gt;以下是 2026 年 4090（24GB）实测可用的国产大模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求&lt;/th&gt;
					&lt;th&gt;推荐场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Qwen3-30B-A3B&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;30B/3B激活&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;⭐ 日常对话+编程&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;需要最高质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;~15GB&lt;/td&gt;
					&lt;td&gt;需INT8，平衡之选&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~16GB&lt;/td&gt;
					&lt;td&gt;轻量级，速度最快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1-32B（蒸馏）&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;INT4&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;推理/数学任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;GLM 生态兼容&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;推理增强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;场景推荐&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话&lt;/strong&gt;：Qwen3-30B-A3B（速度快、质量好）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;编程辅助&lt;/strong&gt;：Qwen3-30B-A3B 或 Qwen3-32B（代码能力 32B 更强）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数学/推理&lt;/strong&gt;：DeepSeek-R1-32B 蒸馏版（推理任务专项优化）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent/工具调用&lt;/strong&gt;：Qwen3-30B-A3B（速度快，适合多轮工具调用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM 生态&lt;/strong&gt;：GLM-Z1-9B（但能力有限，复杂任务建议 API）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="框架选择--ollama-vs-vllm-vs-sglang"&gt;框架选择 — Ollama vs vLLM vs SGLang
&lt;/h2&gt;&lt;p&gt;选完模型，还要选推理框架。三个主流选择：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;框架&lt;/th&gt;
					&lt;th&gt;优势&lt;/th&gt;
					&lt;th&gt;劣势&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;5分钟上手，一键安装&lt;/td&gt;
					&lt;td&gt;并发性能一般&lt;/td&gt;
					&lt;td&gt;个人使用、开发调试&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;高并发吞吐&lt;/td&gt;
					&lt;td&gt;配置复杂&lt;/td&gt;
					&lt;td&gt;服务化部署、多人共用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SGLang&lt;/td&gt;
					&lt;td&gt;Agent/工具调用优化&lt;/td&gt;
					&lt;td&gt;生态较小&lt;/td&gt;
					&lt;td&gt;AI Agent 开发&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Ollama（推荐大多数人）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 拉取模型（自动选 Q4_K_M）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 运行&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;5 分钟搞定，适合个人开发者。Ollama 会自动根据你的显存选择量化方案，不需要手动配置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;vLLM（需要高并发时）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;8192&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果你要给团队用，或者需要同时处理多个请求，vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGLang（Agent 开发专用）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install sglang
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m sglang.launch_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model-path Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;SGLang 对工具调用和结构化输出有专门优化，如果你在做 AI Agent 开发，值得试试。&lt;/p&gt;
&lt;h2 id="结论消费级显卡本地部署的理性预期"&gt;结论：消费级显卡本地部署的理性预期
&lt;/h2&gt;&lt;p&gt;一张 4090 能跑的国产大模型，比 2025 年多了不少，但别指望能跑旗舰。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得本地跑的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;日常对话、写作辅助（Qwen3-30B-A3B 足够）&lt;/li&gt;
&lt;li&gt;编程辅助（30B-A3B 或 32B，取决于代码复杂度）&lt;/li&gt;
&lt;li&gt;隐私敏感任务（不能把数据发到云端）&lt;/li&gt;
&lt;li&gt;高频调用（API 按 token 计费，高频场景本地更划算）&lt;/li&gt;
&lt;li&gt;学习和实验（理解模型推理过程）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;用 API 更划算的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要最强模型能力（GLM-5.2、DeepSeek V4 旗舰版）&lt;/li&gt;
&lt;li&gt;低频使用（偶尔用一次，不值得买显卡）&lt;/li&gt;
&lt;li&gt;多模态任务（图像、语音理解，本地模型支持有限）&lt;/li&gt;
&lt;li&gt;长上下文（本地模型上下文窗口通常 8K-32K，API 可以 128K+）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的现实是：MoE 架构让消费级显卡也能跑「够用」的大模型，但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合，别被 GLM-5.2 的参数量迷了眼。&lt;/p&gt;
&lt;p&gt;作者：varkm&lt;/p&gt;</description></item></channel></rss>