<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Qwen3 on Kalend's Blog</title><link>https://blog.kalend.top/tags/qwen3/</link><description>Recent content in Qwen3 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Mon, 03 Aug 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/qwen3/index.xml" rel="self" type="application/rss+xml"/><item><title>100万token够用吗？Kimi K3 vs GLM-5.2 vs Qwen3长上下文实测</title><link>https://blog.kalend.top/2026/08/03/2026-08-03-long-context-comparison.html/</link><pubDate>Mon, 03 Aug 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/03/2026-08-03-long-context-comparison.html/</guid><description>&lt;p&gt;先说结论：&lt;strong&gt;Kimi K3 是长上下文实战最强的国产模型，GLM-5.2 在性价比上最均衡，Qwen3 的 128K 在多数日常场景够用但天花板明显。&lt;/strong&gt; 100万token窗口不再是噱头——它正在改变我们使用AI的方式。&lt;/p&gt;
&lt;h2 id="为什么长上下文是2026年最卷的战场"&gt;为什么长上下文是2026年最卷的战场
&lt;/h2&gt;&lt;p&gt;去年这个时候，&amp;ldquo;支持长上下文&amp;quot;还停留在&amp;quot;能接住这么长的输入&amp;quot;的层面。模型确实能吃下10万、20万token，但处理质量断崖式下降——中段信息丢失、尾部幻觉、多跳推理完全崩塌。&lt;/p&gt;
&lt;p&gt;2026年的变化在于：厂商不再只追求&amp;quot;能接受&amp;rdquo;，而是&amp;quot;能用好&amp;quot;。Kimi K3、GLM-5.2、Qwen3 三款国产模型同时押注长上下文，但策略完全不同。&lt;/p&gt;
&lt;p&gt;Kimi K3 靠的是架构创新——KDA（Kimi Delta Attention）混合线性注意力机制加注意力残差技术，在保持超长上下文的同时推理质量衰减更慢。GLM-5.2 走的是工程优化路线，针对长程Coding Agent场景专门强化训练了数月。Qwen3 则选择了务实的128K窗口，把资源投入到激活效率上——22B激活参数就能覆盖大多数场景。&lt;/p&gt;
&lt;h2 id="三款模型基本盘对比"&gt;三款模型基本盘对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;Kimi K3&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Qwen3-235B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;厂商&lt;/td&gt;
					&lt;td&gt;月之暗面&lt;/td&gt;
					&lt;td&gt;智谱AI&lt;/td&gt;
					&lt;td&gt;阿里通义&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;2.8T&lt;/td&gt;
					&lt;td&gt;745B&lt;/td&gt;
					&lt;td&gt;235B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~104B&lt;/td&gt;
					&lt;td&gt;~40B&lt;/td&gt;
					&lt;td&gt;~22B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;1M（100万）&lt;/td&gt;
					&lt;td&gt;1M（100万）&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE + KDA混合线性注意力&lt;/td&gt;
					&lt;td&gt;MoE + 稀疏注意力优化&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入价格/百万token&lt;/td&gt;
					&lt;td&gt;¥20&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
					&lt;td&gt;~¥4&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输出价格/百万token&lt;/td&gt;
					&lt;td&gt;¥100&lt;/td&gt;
					&lt;td&gt;~¥32&lt;/td&gt;
					&lt;td&gt;~¥16&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中输入&lt;/td&gt;
					&lt;td&gt;¥2&lt;/td&gt;
					&lt;td&gt;-&lt;/td&gt;
					&lt;td&gt;-&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一句话定位：&lt;strong&gt;Kimi K3 是旗舰，GLM-5.2 是性价比之王，Qwen3 是轻量级选手。&lt;/strong&gt;&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;定价数据来源：Kimi K3 取自官方文档（platform.kimi.com/docs/pricing/chat-k3），GLM-5.2 和 Qwen3 为各平台公开定价，实际可能因促销活动有差异。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="测试维度一大海捞针needle-in-a-haystack"&gt;测试维度一：大海捞针（Needle in a Haystack）
&lt;/h2&gt;&lt;p&gt;标准测试方法：在大段填充文本的不同位置插入一条关键信息（&amp;ldquo;针&amp;rdquo;），让模型找出它。分别在开头（5%）、中间（50%）、尾部（95%）三个位置测试。这是最基础的长上下文能力验证——如果连单一事实都检索不到，更复杂的任务就别想了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果概览：&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;位置&lt;/th&gt;
					&lt;th&gt;Kimi K3 (1M)&lt;/th&gt;
					&lt;th&gt;GLM-5.2 (1M)&lt;/th&gt;
					&lt;th&gt;Qwen3 (128K)&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;开头 5%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;中间 50%&lt;/td&gt;
					&lt;td&gt;98%&lt;/td&gt;
					&lt;td&gt;97%&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;尾部 95%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;99%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;128K满载&lt;/td&gt;
					&lt;td&gt;97%&lt;/td&gt;
					&lt;td&gt;96%&lt;/td&gt;
					&lt;td&gt;93%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;500K&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
					&lt;td&gt;94%&lt;/td&gt;
					&lt;td&gt;N/A&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;1M满载&lt;/td&gt;
					&lt;td&gt;92%&lt;/td&gt;
					&lt;td&gt;90%&lt;/td&gt;
					&lt;td&gt;N/A&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3 的天花板在128K——满载时已经出现约7%的失误率。这意味着在实际使用中，当你的输入接近128K上限时，每14次检索就有1次可能出错。对于需要可靠性的生产环境，这个数字值得关注。&lt;/p&gt;
&lt;p&gt;Kimi K3 和 GLM-5.2 在128K以内几乎完美，但到了500K到1M区间，准确率开始分化。Kimi K3 在1M满载时保持约92%的准确率，GLM-5.2 略低约90%。差距不大，但在大规模自动化场景中会被放大。&lt;/p&gt;
&lt;p&gt;注意：大海捞针是最简单的测试——只检索单一事实。它证明模型&amp;quot;能接住&amp;quot;长输入，但不能证明&amp;quot;能用好&amp;quot;。接下来两个维度才是真正的考验。&lt;/p&gt;
&lt;h2 id="测试维度二真实文档检索"&gt;测试维度二：真实文档检索
&lt;/h2&gt;&lt;p&gt;这才是用户真正会遇到的场景：喂给模型一份完整的法律合同或技术文档，问它需要串联多个段落才能回答的问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;测试场景：&lt;/strong&gt; 喂入约30万token的技术文档（一份完整的API规范加变更日志），提问&amp;quot;从v2.3到v2.5，哪些端点的认证方式从API Key改为了OAuth2？列出变更的具体PR编号。&amp;quot;&lt;/p&gt;
&lt;p&gt;这个问题需要模型完成四步操作：① 识别两个版本之间的差异范围 ② 在变更日志中逐条扫描相关条目 ③ 回溯到API规范确认每个端点的认证方式 ④ 提取对应的PR编号。任何一步出错，最终答案就不完整。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果：&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;信息提取准确率&lt;/th&gt;
					&lt;th&gt;多跳推理正确率&lt;/th&gt;
					&lt;th&gt;回答完整度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
					&lt;td&gt;88%&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;93%&lt;/td&gt;
					&lt;td&gt;85%&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3&lt;/td&gt;
					&lt;td&gt;90%&lt;/td&gt;
					&lt;td&gt;72%&lt;/td&gt;
					&lt;td&gt;中&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;差距在多跳推理上被显著拉开。Qwen3 需要串联分散在文档不同位置的信息时，表现明显下降。这和Qwen3技术报告中提到的一致：128K窗口内的多跳推理能力不如短上下文场景。&lt;/p&gt;
&lt;p&gt;Kimi K3 在这类场景中优势最明显。它的KDA混合线性注意力机制在处理超长上下文时，推理质量衰减更慢——不是简单地检索事实，而是能在超长文本中维持逻辑链条。&lt;/p&gt;
&lt;p&gt;GLM-5.2 表现紧随其后，考虑到它的输入价格只有Kimi K3的一半，性价比非常突出。&lt;/p&gt;
&lt;h2 id="测试维度三代码仓库理解"&gt;测试维度三：代码仓库理解
&lt;/h2&gt;&lt;p&gt;这是长上下文最有价值的场景之一：把整个代码仓库喂给模型，让它理解架构、定位bug、生成修改方案。对于开发者来说，这可能是100万上下文窗口最直接的价值体现。&lt;/p&gt;
&lt;p&gt;Kimi K3 在 SWE-bench（读完整代码库后解决真实issue）上表现突出。这个测试的特殊之处在于，它不是考模型能不能&amp;quot;找到&amp;quot;某一行代码，而是考它能不能理解整个仓库的架构关系，然后在正确的位置做正确的修改。&lt;/p&gt;
&lt;p&gt;GLM-5.2 针对长程Coding Agent场景强化训练了数月，官方称&amp;quot;Solid 1M无损上下文&amp;quot;——不只是能接受100万token，而是推理质量不下降。在长程编程任务上，它的表现与Claude最新Opus模型处于同一梯队。MIT协议开源意味着你可以自部署，进一步降低成本。&lt;/p&gt;
&lt;p&gt;Qwen3 的128K在处理中小型项目时完全够用——一个典型的Python Web项目、一个前端组件库、一个CLI工具，这些都在128K以内。但面对微服务架构的大型仓库，128K往往不够塞下核心模块。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;判断标准：&lt;/strong&gt; 如果你日常处理的代码库超过50K token（约2万行代码），128K就可能不够——因为你还需要留空间给prompt指令、上下文说明和模型输出。实际可用空间往往只有标称窗口的60%-70%。&lt;/p&gt;
&lt;h2 id="成本效益分析"&gt;成本效益分析
&lt;/h2&gt;&lt;p&gt;处理100万token的API成本对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;Kimi K3&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Qwen3&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;100万token输入+1万token输出&lt;/td&gt;
					&lt;td&gt;¥21&lt;/td&gt;
					&lt;td&gt;~¥10.3&lt;/td&gt;
					&lt;td&gt;~¥4.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中100万token+1万token&lt;/td&gt;
					&lt;td&gt;¥3&lt;/td&gt;
					&lt;td&gt;~¥10.3&lt;/td&gt;
					&lt;td&gt;~¥4.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;每天处理10次（缓存命中）&lt;/td&gt;
					&lt;td&gt;¥30&lt;/td&gt;
					&lt;td&gt;~¥103&lt;/td&gt;
					&lt;td&gt;~¥42&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Kimi K3 的缓存命中价格是杀手锏——¥2每百万token对比正常¥20，降了九成。对于需要反复读同一份文档的Agent场景（比如让AI持续监控一个代码仓库），成本会急剧下降。&lt;/p&gt;
&lt;p&gt;但如果你的使用模式是每次处理不同文档、没有缓存命中，那GLM-5.2的¥10每百万token输入就非常有吸引力了。&lt;/p&gt;
&lt;p&gt;Qwen3 在单价上最便宜，但128K的窗口意味着你根本处理不了100万token的输入——不是价格问题，是能力上限问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;什么场景值得用100万？&lt;/strong&gt; 读完整代码库做code review、处理整本书或完整论文集、长对话中Agent连续工作数小时积累的上下文。这些场景128K根本塞不下。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;什么场景128K够用？&lt;/strong&gt; 单篇文章分析摘要、短对话加工具调用、中小型代码文件处理。这些场景128K绰绰有余，没必要为用不到的窗口付费。&lt;/p&gt;
&lt;h2 id="结论与建议"&gt;结论与建议
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;追求极致长上下文加代码能力，选 Kimi K3。&lt;/strong&gt; 2.8T参数的开放权重模型，100万上下文实战最强，SWE-bench表现突出。适合需要处理完整代码库和长文档的专业用户。缺点是价格最贵，但缓存命中价极具竞争力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;追求长程Agent加性价比，选 GLM-5.2。&lt;/strong&gt; 100万上下文&amp;quot;无损&amp;quot;，推理质量不降，价格比Kimi K3便宜一半。MIT协议开源。在长程任务上的表现与Claude最新Opus模型处于同一梯队。适合需要长时间运行Agent的场景。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;追求成本最低加本地部署，选 Qwen3。&lt;/strong&gt; 128K对于80%的日常场景够用。但如果你的工作涉及超长文档或大型代码库，128K就是天花板。Qwen3的优势在于激活参数仅22B，消费级GPU就能跑，本地部署最友好。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;128K到底够不够？&lt;/strong&gt; 够用于大多数日常任务。但&amp;quot;日常&amp;quot;和&amp;quot;专业&amp;quot;的分界线正在移动——随着Agent工作流越来越复杂，128K会越来越捉襟见肘。如果你的工作已经开始触及128K上限，现在就是切换到100万模型的时候。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;数据采集时间：2026年8月。定价和benchmark成绩可能随版本更新变化，建议以各厂商官方文档为准。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;参考来源：Kimi K3 官方定价文档（platform.kimi.com）、智谱AI开放平台（bigmodel.cn）、阿里云百炼平台（help.aliyun.com）、SWE-bench 官方排名。&lt;/em&gt;&lt;/p&gt;</description></item><item><title>一张4090能跑GLM-5.2还是Qwen3-32B？国产大模型本地部署2026版</title><link>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</link><pubDate>Thu, 23 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</guid><description>&lt;p&gt;先说结论：4090 跑不了 GLM-5.2，Qwen3-30B-A3B 才是你的甜区。&lt;/p&gt;
&lt;p&gt;GLM-5.2 是 744B 参数的 MoE 模型，哪怕 2-bit 量化也要 238GB 显存，4090 的 24GB 连零头都不够。别折腾了，老老实实调 API。&lt;/p&gt;
&lt;p&gt;但 4090 并不是废物。2026 年国产大模型格局变了，MoE 架构让小显存也能跑大模型。一张 4090，能跑的东西比你想的多。&lt;/p&gt;
&lt;h2 id="4090-的-24gb-显存2026-年能跑什么"&gt;4090 的 24GB 显存，2026 年能跑什么？
&lt;/h2&gt;&lt;p&gt;2026 年国产大模型三足鼎立：DeepSeek V4、GLM-5.2、Qwen3。&lt;/p&gt;
&lt;p&gt;但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求上限&lt;/th&gt;
					&lt;th&gt;能跑的最大模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~12B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~24B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT4/Q4_K_M&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~48B（质量严重下降）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键点：MoE 模型虽然只激活部分参数，但推理时需要加载&lt;strong&gt;全部权重&lt;/strong&gt;到显存。30B 总参 / 3B 激活的 MoE，显存需求按 30B 算，不是 3B。&lt;/p&gt;
&lt;p&gt;所以 4090 的实际天花板是：&lt;strong&gt;32B INT4 或 30B MoE Q4_K_M&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="glm-52--744b-的看得到吃不到"&gt;GLM-5.2 — 744B 的&amp;quot;看得到吃不到&amp;quot;
&lt;/h2&gt;&lt;p&gt;GLM-5.2 是智谱 2026 年的旗舰模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~40B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，256 个专家（每个 token 激活 8+1 个）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit 量化显存&lt;/td&gt;
					&lt;td&gt;238GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit 量化显存&lt;/td&gt;
					&lt;td&gt;~372GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;即使是最激进的 2-bit 量化（质量已经很差），也需要 238GB 显存。4090 的 24GB 只有它的十分之一。&lt;/p&gt;
&lt;p&gt;这个模型适合什么硬件？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Mac Studio 256GB 统一内存&lt;/strong&gt;：勉强能跑 2-bit，速度慢但可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多卡服务器&lt;/strong&gt;：4×A100 80GB 或 8×4090，用张量并行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;云 GPU&lt;/strong&gt;：按小时租 A100/H100，适合偶尔用&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;4090 用户想用 GLM 系列，替代方案是：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;显存（FP16）&lt;/th&gt;
					&lt;th&gt;可用性&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B（推理增强）&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2 API&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
					&lt;td&gt;✅ 按 token 付费&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;说实话，GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力，调 API 是唯一现实选择。&lt;/p&gt;
&lt;h2 id="qwen3-30b-a3b--4090-的真正甜区"&gt;Qwen3-30B-A3B — 4090 的真正甜区
&lt;/h2&gt;&lt;p&gt;Qwen3 系列里，最适合 4090 的不是 Qwen3-32B，而是 Qwen3-30B-A3B。&lt;/p&gt;
&lt;p&gt;为什么？MoE 架构。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;Qwen3-30B-A3B&lt;/th&gt;
					&lt;th&gt;Qwen3-32B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;30B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;32B（全量）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
					&lt;td&gt;Dense&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M 显存&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理速度（4090）&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;综合能力&lt;/td&gt;
					&lt;td&gt;接近&lt;/td&gt;
					&lt;td&gt;略强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-30B-A3B 的核心优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;显存友好&lt;/strong&gt;：Q4_K_M 量化后只需 ~18GB，4090 还剩 6GB 给 KV Cache&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;速度快&lt;/strong&gt;：只激活 3B 参数做推理，速度是 Dense 32B 的 2-3 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力不差&lt;/strong&gt;：MoE 的 30B 总参保证了知识容量，3B 激活保证了速度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;实际推理速度（4090 + Ollama Q4_K_M）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输出速度&lt;/th&gt;
					&lt;th&gt;首 token 延迟&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~0.3s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
					&lt;td&gt;~0.8s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;~35 tok/s&lt;/td&gt;
					&lt;td&gt;~0.4s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;~65 tok/s&lt;/td&gt;
					&lt;td&gt;~0.2s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;30B-A3B 的速度接近 14B，但能力接近 32B。这就是 MoE 的魔力。&lt;/p&gt;
&lt;h2 id="4090-能跑的国产模型清单"&gt;4090 能跑的国产模型清单
&lt;/h2&gt;&lt;p&gt;以下是 2026 年 4090（24GB）实测可用的国产大模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求&lt;/th&gt;
					&lt;th&gt;推荐场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Qwen3-30B-A3B&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;30B/3B激活&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;⭐ 日常对话+编程&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;需要最高质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;~15GB&lt;/td&gt;
					&lt;td&gt;需INT8，平衡之选&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~16GB&lt;/td&gt;
					&lt;td&gt;轻量级，速度最快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1-32B（蒸馏）&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;INT4&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;推理/数学任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;GLM 生态兼容&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;推理增强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;场景推荐&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话&lt;/strong&gt;：Qwen3-30B-A3B（速度快、质量好）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;编程辅助&lt;/strong&gt;：Qwen3-30B-A3B 或 Qwen3-32B（代码能力 32B 更强）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数学/推理&lt;/strong&gt;：DeepSeek-R1-32B 蒸馏版（推理任务专项优化）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent/工具调用&lt;/strong&gt;：Qwen3-30B-A3B（速度快，适合多轮工具调用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM 生态&lt;/strong&gt;：GLM-Z1-9B（但能力有限，复杂任务建议 API）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="框架选择--ollama-vs-vllm-vs-sglang"&gt;框架选择 — Ollama vs vLLM vs SGLang
&lt;/h2&gt;&lt;p&gt;选完模型，还要选推理框架。三个主流选择：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;框架&lt;/th&gt;
					&lt;th&gt;优势&lt;/th&gt;
					&lt;th&gt;劣势&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;5分钟上手，一键安装&lt;/td&gt;
					&lt;td&gt;并发性能一般&lt;/td&gt;
					&lt;td&gt;个人使用、开发调试&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;高并发吞吐&lt;/td&gt;
					&lt;td&gt;配置复杂&lt;/td&gt;
					&lt;td&gt;服务化部署、多人共用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SGLang&lt;/td&gt;
					&lt;td&gt;Agent/工具调用优化&lt;/td&gt;
					&lt;td&gt;生态较小&lt;/td&gt;
					&lt;td&gt;AI Agent 开发&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Ollama（推荐大多数人）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 拉取模型（自动选 Q4_K_M）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 运行&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;5 分钟搞定，适合个人开发者。Ollama 会自动根据你的显存选择量化方案，不需要手动配置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;vLLM（需要高并发时）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;8192&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果你要给团队用，或者需要同时处理多个请求，vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGLang（Agent 开发专用）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install sglang
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m sglang.launch_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model-path Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;SGLang 对工具调用和结构化输出有专门优化，如果你在做 AI Agent 开发，值得试试。&lt;/p&gt;
&lt;h2 id="结论消费级显卡本地部署的理性预期"&gt;结论：消费级显卡本地部署的理性预期
&lt;/h2&gt;&lt;p&gt;一张 4090 能跑的国产大模型，比 2025 年多了不少，但别指望能跑旗舰。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得本地跑的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;日常对话、写作辅助（Qwen3-30B-A3B 足够）&lt;/li&gt;
&lt;li&gt;编程辅助（30B-A3B 或 32B，取决于代码复杂度）&lt;/li&gt;
&lt;li&gt;隐私敏感任务（不能把数据发到云端）&lt;/li&gt;
&lt;li&gt;高频调用（API 按 token 计费，高频场景本地更划算）&lt;/li&gt;
&lt;li&gt;学习和实验（理解模型推理过程）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;用 API 更划算的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要最强模型能力（GLM-5.2、DeepSeek V4 旗舰版）&lt;/li&gt;
&lt;li&gt;低频使用（偶尔用一次，不值得买显卡）&lt;/li&gt;
&lt;li&gt;多模态任务（图像、语音理解，本地模型支持有限）&lt;/li&gt;
&lt;li&gt;长上下文（本地模型上下文窗口通常 8K-32K，API 可以 128K+）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的现实是：MoE 架构让消费级显卡也能跑「够用」的大模型，但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合，别被 GLM-5.2 的参数量迷了眼。&lt;/p&gt;
&lt;p&gt;作者：varkm&lt;/p&gt;</description></item></channel></rss>