<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GLM-5.2 on Kalend's Blog</title><link>https://blog.kalend.top/tags/glm-5.2/</link><description>Recent content in GLM-5.2 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Mon, 03 Aug 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/glm-5.2/index.xml" rel="self" type="application/rss+xml"/><item><title>100万token够用吗？Kimi K3 vs GLM-5.2 vs Qwen3长上下文实测</title><link>https://blog.kalend.top/2026/08/03/2026-08-03-long-context-comparison.html/</link><pubDate>Mon, 03 Aug 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/03/2026-08-03-long-context-comparison.html/</guid><description>&lt;p&gt;先说结论：&lt;strong&gt;Kimi K3 是长上下文实战最强的国产模型，GLM-5.2 在性价比上最均衡，Qwen3 的 128K 在多数日常场景够用但天花板明显。&lt;/strong&gt; 100万token窗口不再是噱头——它正在改变我们使用AI的方式。&lt;/p&gt;
&lt;h2 id="为什么长上下文是2026年最卷的战场"&gt;为什么长上下文是2026年最卷的战场
&lt;/h2&gt;&lt;p&gt;去年这个时候，&amp;ldquo;支持长上下文&amp;quot;还停留在&amp;quot;能接住这么长的输入&amp;quot;的层面。模型确实能吃下10万、20万token，但处理质量断崖式下降——中段信息丢失、尾部幻觉、多跳推理完全崩塌。&lt;/p&gt;
&lt;p&gt;2026年的变化在于：厂商不再只追求&amp;quot;能接受&amp;rdquo;，而是&amp;quot;能用好&amp;quot;。Kimi K3、GLM-5.2、Qwen3 三款国产模型同时押注长上下文，但策略完全不同。&lt;/p&gt;
&lt;p&gt;Kimi K3 靠的是架构创新——KDA（Kimi Delta Attention）混合线性注意力机制加注意力残差技术，在保持超长上下文的同时推理质量衰减更慢。GLM-5.2 走的是工程优化路线，针对长程Coding Agent场景专门强化训练了数月。Qwen3 则选择了务实的128K窗口，把资源投入到激活效率上——22B激活参数就能覆盖大多数场景。&lt;/p&gt;
&lt;h2 id="三款模型基本盘对比"&gt;三款模型基本盘对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;Kimi K3&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Qwen3-235B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;厂商&lt;/td&gt;
					&lt;td&gt;月之暗面&lt;/td&gt;
					&lt;td&gt;智谱AI&lt;/td&gt;
					&lt;td&gt;阿里通义&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;2.8T&lt;/td&gt;
					&lt;td&gt;745B&lt;/td&gt;
					&lt;td&gt;235B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~104B&lt;/td&gt;
					&lt;td&gt;~40B&lt;/td&gt;
					&lt;td&gt;~22B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;1M（100万）&lt;/td&gt;
					&lt;td&gt;1M（100万）&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE + KDA混合线性注意力&lt;/td&gt;
					&lt;td&gt;MoE + 稀疏注意力优化&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入价格/百万token&lt;/td&gt;
					&lt;td&gt;¥20&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
					&lt;td&gt;~¥4&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输出价格/百万token&lt;/td&gt;
					&lt;td&gt;¥100&lt;/td&gt;
					&lt;td&gt;~¥32&lt;/td&gt;
					&lt;td&gt;~¥16&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中输入&lt;/td&gt;
					&lt;td&gt;¥2&lt;/td&gt;
					&lt;td&gt;-&lt;/td&gt;
					&lt;td&gt;-&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一句话定位：&lt;strong&gt;Kimi K3 是旗舰，GLM-5.2 是性价比之王，Qwen3 是轻量级选手。&lt;/strong&gt;&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;定价数据来源：Kimi K3 取自官方文档（platform.kimi.com/docs/pricing/chat-k3），GLM-5.2 和 Qwen3 为各平台公开定价，实际可能因促销活动有差异。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="测试维度一大海捞针needle-in-a-haystack"&gt;测试维度一：大海捞针（Needle in a Haystack）
&lt;/h2&gt;&lt;p&gt;标准测试方法：在大段填充文本的不同位置插入一条关键信息（&amp;ldquo;针&amp;rdquo;），让模型找出它。分别在开头（5%）、中间（50%）、尾部（95%）三个位置测试。这是最基础的长上下文能力验证——如果连单一事实都检索不到，更复杂的任务就别想了。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果概览：&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;位置&lt;/th&gt;
					&lt;th&gt;Kimi K3 (1M)&lt;/th&gt;
					&lt;th&gt;GLM-5.2 (1M)&lt;/th&gt;
					&lt;th&gt;Qwen3 (128K)&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;开头 5%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;中间 50%&lt;/td&gt;
					&lt;td&gt;98%&lt;/td&gt;
					&lt;td&gt;97%&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;尾部 95%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
					&lt;td&gt;99%&lt;/td&gt;
					&lt;td&gt;100%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;128K满载&lt;/td&gt;
					&lt;td&gt;97%&lt;/td&gt;
					&lt;td&gt;96%&lt;/td&gt;
					&lt;td&gt;93%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;500K&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
					&lt;td&gt;94%&lt;/td&gt;
					&lt;td&gt;N/A&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;1M满载&lt;/td&gt;
					&lt;td&gt;92%&lt;/td&gt;
					&lt;td&gt;90%&lt;/td&gt;
					&lt;td&gt;N/A&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3 的天花板在128K——满载时已经出现约7%的失误率。这意味着在实际使用中，当你的输入接近128K上限时，每14次检索就有1次可能出错。对于需要可靠性的生产环境，这个数字值得关注。&lt;/p&gt;
&lt;p&gt;Kimi K3 和 GLM-5.2 在128K以内几乎完美，但到了500K到1M区间，准确率开始分化。Kimi K3 在1M满载时保持约92%的准确率，GLM-5.2 略低约90%。差距不大，但在大规模自动化场景中会被放大。&lt;/p&gt;
&lt;p&gt;注意：大海捞针是最简单的测试——只检索单一事实。它证明模型&amp;quot;能接住&amp;quot;长输入，但不能证明&amp;quot;能用好&amp;quot;。接下来两个维度才是真正的考验。&lt;/p&gt;
&lt;h2 id="测试维度二真实文档检索"&gt;测试维度二：真实文档检索
&lt;/h2&gt;&lt;p&gt;这才是用户真正会遇到的场景：喂给模型一份完整的法律合同或技术文档，问它需要串联多个段落才能回答的问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;测试场景：&lt;/strong&gt; 喂入约30万token的技术文档（一份完整的API规范加变更日志），提问&amp;quot;从v2.3到v2.5，哪些端点的认证方式从API Key改为了OAuth2？列出变更的具体PR编号。&amp;quot;&lt;/p&gt;
&lt;p&gt;这个问题需要模型完成四步操作：① 识别两个版本之间的差异范围 ② 在变更日志中逐条扫描相关条目 ③ 回溯到API规范确认每个端点的认证方式 ④ 提取对应的PR编号。任何一步出错，最终答案就不完整。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;结果：&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;信息提取准确率&lt;/th&gt;
					&lt;th&gt;多跳推理正确率&lt;/th&gt;
					&lt;th&gt;回答完整度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;95%&lt;/td&gt;
					&lt;td&gt;88%&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;93%&lt;/td&gt;
					&lt;td&gt;85%&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3&lt;/td&gt;
					&lt;td&gt;90%&lt;/td&gt;
					&lt;td&gt;72%&lt;/td&gt;
					&lt;td&gt;中&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;差距在多跳推理上被显著拉开。Qwen3 需要串联分散在文档不同位置的信息时，表现明显下降。这和Qwen3技术报告中提到的一致：128K窗口内的多跳推理能力不如短上下文场景。&lt;/p&gt;
&lt;p&gt;Kimi K3 在这类场景中优势最明显。它的KDA混合线性注意力机制在处理超长上下文时，推理质量衰减更慢——不是简单地检索事实，而是能在超长文本中维持逻辑链条。&lt;/p&gt;
&lt;p&gt;GLM-5.2 表现紧随其后，考虑到它的输入价格只有Kimi K3的一半，性价比非常突出。&lt;/p&gt;
&lt;h2 id="测试维度三代码仓库理解"&gt;测试维度三：代码仓库理解
&lt;/h2&gt;&lt;p&gt;这是长上下文最有价值的场景之一：把整个代码仓库喂给模型，让它理解架构、定位bug、生成修改方案。对于开发者来说，这可能是100万上下文窗口最直接的价值体现。&lt;/p&gt;
&lt;p&gt;Kimi K3 在 SWE-bench（读完整代码库后解决真实issue）上表现突出。这个测试的特殊之处在于，它不是考模型能不能&amp;quot;找到&amp;quot;某一行代码，而是考它能不能理解整个仓库的架构关系，然后在正确的位置做正确的修改。&lt;/p&gt;
&lt;p&gt;GLM-5.2 针对长程Coding Agent场景强化训练了数月，官方称&amp;quot;Solid 1M无损上下文&amp;quot;——不只是能接受100万token，而是推理质量不下降。在长程编程任务上，它的表现与Claude最新Opus模型处于同一梯队。MIT协议开源意味着你可以自部署，进一步降低成本。&lt;/p&gt;
&lt;p&gt;Qwen3 的128K在处理中小型项目时完全够用——一个典型的Python Web项目、一个前端组件库、一个CLI工具，这些都在128K以内。但面对微服务架构的大型仓库，128K往往不够塞下核心模块。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;判断标准：&lt;/strong&gt; 如果你日常处理的代码库超过50K token（约2万行代码），128K就可能不够——因为你还需要留空间给prompt指令、上下文说明和模型输出。实际可用空间往往只有标称窗口的60%-70%。&lt;/p&gt;
&lt;h2 id="成本效益分析"&gt;成本效益分析
&lt;/h2&gt;&lt;p&gt;处理100万token的API成本对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;Kimi K3&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Qwen3&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;100万token输入+1万token输出&lt;/td&gt;
					&lt;td&gt;¥21&lt;/td&gt;
					&lt;td&gt;~¥10.3&lt;/td&gt;
					&lt;td&gt;~¥4.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中100万token+1万token&lt;/td&gt;
					&lt;td&gt;¥3&lt;/td&gt;
					&lt;td&gt;~¥10.3&lt;/td&gt;
					&lt;td&gt;~¥4.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;每天处理10次（缓存命中）&lt;/td&gt;
					&lt;td&gt;¥30&lt;/td&gt;
					&lt;td&gt;~¥103&lt;/td&gt;
					&lt;td&gt;~¥42&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Kimi K3 的缓存命中价格是杀手锏——¥2每百万token对比正常¥20，降了九成。对于需要反复读同一份文档的Agent场景（比如让AI持续监控一个代码仓库），成本会急剧下降。&lt;/p&gt;
&lt;p&gt;但如果你的使用模式是每次处理不同文档、没有缓存命中，那GLM-5.2的¥10每百万token输入就非常有吸引力了。&lt;/p&gt;
&lt;p&gt;Qwen3 在单价上最便宜，但128K的窗口意味着你根本处理不了100万token的输入——不是价格问题，是能力上限问题。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;什么场景值得用100万？&lt;/strong&gt; 读完整代码库做code review、处理整本书或完整论文集、长对话中Agent连续工作数小时积累的上下文。这些场景128K根本塞不下。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;什么场景128K够用？&lt;/strong&gt; 单篇文章分析摘要、短对话加工具调用、中小型代码文件处理。这些场景128K绰绰有余，没必要为用不到的窗口付费。&lt;/p&gt;
&lt;h2 id="结论与建议"&gt;结论与建议
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;追求极致长上下文加代码能力，选 Kimi K3。&lt;/strong&gt; 2.8T参数的开放权重模型，100万上下文实战最强，SWE-bench表现突出。适合需要处理完整代码库和长文档的专业用户。缺点是价格最贵，但缓存命中价极具竞争力。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;追求长程Agent加性价比，选 GLM-5.2。&lt;/strong&gt; 100万上下文&amp;quot;无损&amp;quot;，推理质量不降，价格比Kimi K3便宜一半。MIT协议开源。在长程任务上的表现与Claude最新Opus模型处于同一梯队。适合需要长时间运行Agent的场景。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;追求成本最低加本地部署，选 Qwen3。&lt;/strong&gt; 128K对于80%的日常场景够用。但如果你的工作涉及超长文档或大型代码库，128K就是天花板。Qwen3的优势在于激活参数仅22B，消费级GPU就能跑，本地部署最友好。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;128K到底够不够？&lt;/strong&gt; 够用于大多数日常任务。但&amp;quot;日常&amp;quot;和&amp;quot;专业&amp;quot;的分界线正在移动——随着Agent工作流越来越复杂，128K会越来越捉襟见肘。如果你的工作已经开始触及128K上限，现在就是切换到100万模型的时候。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;数据采集时间：2026年8月。定价和benchmark成绩可能随版本更新变化，建议以各厂商官方文档为准。&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;&lt;em&gt;参考来源：Kimi K3 官方定价文档（platform.kimi.com）、智谱AI开放平台（bigmodel.cn）、阿里云百炼平台（help.aliyun.com）、SWE-bench 官方排名。&lt;/em&gt;&lt;/p&gt;</description></item><item><title>一张4090能跑GLM-5.2还是Qwen3-32B？国产大模型本地部署2026版</title><link>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</link><pubDate>Thu, 23 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/23/2026-07-23-4090-local-model-deploy.html/</guid><description>&lt;p&gt;先说结论：4090 跑不了 GLM-5.2，Qwen3-30B-A3B 才是你的甜区。&lt;/p&gt;
&lt;p&gt;GLM-5.2 是 744B 参数的 MoE 模型，哪怕 2-bit 量化也要 238GB 显存，4090 的 24GB 连零头都不够。别折腾了，老老实实调 API。&lt;/p&gt;
&lt;p&gt;但 4090 并不是废物。2026 年国产大模型格局变了，MoE 架构让小显存也能跑大模型。一张 4090，能跑的东西比你想的多。&lt;/p&gt;
&lt;h2 id="4090-的-24gb-显存2026-年能跑什么"&gt;4090 的 24GB 显存，2026 年能跑什么？
&lt;/h2&gt;&lt;p&gt;2026 年国产大模型三足鼎立：DeepSeek V4、GLM-5.2、Qwen3。&lt;/p&gt;
&lt;p&gt;但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求上限&lt;/th&gt;
					&lt;th&gt;能跑的最大模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~12B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~24B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;INT4/Q4_K_M&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit&lt;/td&gt;
					&lt;td&gt;24GB&lt;/td&gt;
					&lt;td&gt;~48B（质量严重下降）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;关键点：MoE 模型虽然只激活部分参数，但推理时需要加载&lt;strong&gt;全部权重&lt;/strong&gt;到显存。30B 总参 / 3B 激活的 MoE，显存需求按 30B 算，不是 3B。&lt;/p&gt;
&lt;p&gt;所以 4090 的实际天花板是：&lt;strong&gt;32B INT4 或 30B MoE Q4_K_M&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="glm-52--744b-的看得到吃不到"&gt;GLM-5.2 — 744B 的&amp;quot;看得到吃不到&amp;quot;
&lt;/h2&gt;&lt;p&gt;GLM-5.2 是智谱 2026 年的旗舰模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;~40B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，256 个专家（每个 token 激活 8+1 个）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;2-bit 量化显存&lt;/td&gt;
					&lt;td&gt;238GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit 量化显存&lt;/td&gt;
					&lt;td&gt;~372GB&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;即使是最激进的 2-bit 量化（质量已经很差），也需要 238GB 显存。4090 的 24GB 只有它的十分之一。&lt;/p&gt;
&lt;p&gt;这个模型适合什么硬件？&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Mac Studio 256GB 统一内存&lt;/strong&gt;：勉强能跑 2-bit，速度慢但可用&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多卡服务器&lt;/strong&gt;：4×A100 80GB 或 8×4090，用张量并行&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;云 GPU&lt;/strong&gt;：按小时租 A100/H100，适合偶尔用&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;4090 用户想用 GLM 系列，替代方案是：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;显存（FP16）&lt;/th&gt;
					&lt;th&gt;可用性&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B（推理增强）&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;✅ 4090 轻松跑&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2 API&lt;/td&gt;
					&lt;td&gt;744B&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
					&lt;td&gt;✅ 按 token 付费&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;说实话，GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力，调 API 是唯一现实选择。&lt;/p&gt;
&lt;h2 id="qwen3-30b-a3b--4090-的真正甜区"&gt;Qwen3-30B-A3B — 4090 的真正甜区
&lt;/h2&gt;&lt;p&gt;Qwen3 系列里，最适合 4090 的不是 Qwen3-32B，而是 Qwen3-30B-A3B。&lt;/p&gt;
&lt;p&gt;为什么？MoE 架构。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;Qwen3-30B-A3B&lt;/th&gt;
					&lt;th&gt;Qwen3-32B&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;30B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;3B&lt;/td&gt;
					&lt;td&gt;32B（全量）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE&lt;/td&gt;
					&lt;td&gt;Dense&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Q4_K_M 显存&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理速度（4090）&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;综合能力&lt;/td&gt;
					&lt;td&gt;接近&lt;/td&gt;
					&lt;td&gt;略强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3-30B-A3B 的核心优势：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;显存友好&lt;/strong&gt;：Q4_K_M 量化后只需 ~18GB，4090 还剩 6GB 给 KV Cache&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;速度快&lt;/strong&gt;：只激活 3B 参数做推理，速度是 Dense 32B 的 2-3 倍&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;能力不差&lt;/strong&gt;：MoE 的 30B 总参保证了知识容量，3B 激活保证了速度&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;实际推理速度（4090 + Ollama Q4_K_M）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输出速度&lt;/th&gt;
					&lt;th&gt;首 token 延迟&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-30B-A3B&lt;/td&gt;
					&lt;td&gt;~45 tok/s&lt;/td&gt;
					&lt;td&gt;~0.3s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;~18 tok/s&lt;/td&gt;
					&lt;td&gt;~0.8s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;~35 tok/s&lt;/td&gt;
					&lt;td&gt;~0.4s&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;~65 tok/s&lt;/td&gt;
					&lt;td&gt;~0.2s&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;30B-A3B 的速度接近 14B，但能力接近 32B。这就是 MoE 的魔力。&lt;/p&gt;
&lt;h2 id="4090-能跑的国产模型清单"&gt;4090 能跑的国产模型清单
&lt;/h2&gt;&lt;p&gt;以下是 2026 年 4090（24GB）实测可用的国产大模型：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;量化方案&lt;/th&gt;
					&lt;th&gt;显存需求&lt;/th&gt;
					&lt;th&gt;推荐场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Qwen3-30B-A3B&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;30B/3B激活&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;⭐ 日常对话+编程&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-32B&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;Q4_K_M&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;需要最高质量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-14B&lt;/td&gt;
					&lt;td&gt;14B&lt;/td&gt;
					&lt;td&gt;INT8&lt;/td&gt;
					&lt;td&gt;~15GB&lt;/td&gt;
					&lt;td&gt;需INT8，平衡之选&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3-8B&lt;/td&gt;
					&lt;td&gt;8B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~16GB&lt;/td&gt;
					&lt;td&gt;轻量级，速度最快&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek-R1-32B（蒸馏）&lt;/td&gt;
					&lt;td&gt;32B&lt;/td&gt;
					&lt;td&gt;INT4&lt;/td&gt;
					&lt;td&gt;~20GB&lt;/td&gt;
					&lt;td&gt;推理/数学任务&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-4-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;GLM 生态兼容&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-Z1-9B&lt;/td&gt;
					&lt;td&gt;9B&lt;/td&gt;
					&lt;td&gt;FP16&lt;/td&gt;
					&lt;td&gt;~18GB&lt;/td&gt;
					&lt;td&gt;推理增强&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;场景推荐&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;日常对话&lt;/strong&gt;：Qwen3-30B-A3B（速度快、质量好）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;编程辅助&lt;/strong&gt;：Qwen3-30B-A3B 或 Qwen3-32B（代码能力 32B 更强）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;数学/推理&lt;/strong&gt;：DeepSeek-R1-32B 蒸馏版（推理任务专项优化）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Agent/工具调用&lt;/strong&gt;：Qwen3-30B-A3B（速度快，适合多轮工具调用）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GLM 生态&lt;/strong&gt;：GLM-Z1-9B（但能力有限，复杂任务建议 API）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="框架选择--ollama-vs-vllm-vs-sglang"&gt;框架选择 — Ollama vs vLLM vs SGLang
&lt;/h2&gt;&lt;p&gt;选完模型，还要选推理框架。三个主流选择：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;框架&lt;/th&gt;
					&lt;th&gt;优势&lt;/th&gt;
					&lt;th&gt;劣势&lt;/th&gt;
					&lt;th&gt;适用场景&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Ollama&lt;/td&gt;
					&lt;td&gt;5分钟上手，一键安装&lt;/td&gt;
					&lt;td&gt;并发性能一般&lt;/td&gt;
					&lt;td&gt;个人使用、开发调试&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;vLLM&lt;/td&gt;
					&lt;td&gt;高并发吞吐&lt;/td&gt;
					&lt;td&gt;配置复杂&lt;/td&gt;
					&lt;td&gt;服务化部署、多人共用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SGLang&lt;/td&gt;
					&lt;td&gt;Agent/工具调用优化&lt;/td&gt;
					&lt;td&gt;生态较小&lt;/td&gt;
					&lt;td&gt;AI Agent 开发&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Ollama（推荐大多数人）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;curl -fsSL https://ollama.com/install.sh &lt;span class="p"&gt;|&lt;/span&gt; sh
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 拉取模型（自动选 Q4_K_M）&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama pull qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 运行&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;ollama run qwen3:30b
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;5 分钟搞定，适合个人开发者。Ollama 会自动根据你的显存选择量化方案，不需要手动配置。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;vLLM（需要高并发时）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;span class="lnt"&gt;8
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install vllm
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动服务&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m vllm.entrypoints.openai.api_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --max-model-len &lt;span class="m"&gt;8192&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;如果你要给团队用，或者需要同时处理多个请求，vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SGLang（Agent 开发专用）&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;div class="chroma"&gt;
&lt;table class="lntable"&gt;&lt;tr&gt;&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code&gt;&lt;span class="lnt"&gt;1
&lt;/span&gt;&lt;span class="lnt"&gt;2
&lt;/span&gt;&lt;span class="lnt"&gt;3
&lt;/span&gt;&lt;span class="lnt"&gt;4
&lt;/span&gt;&lt;span class="lnt"&gt;5
&lt;/span&gt;&lt;span class="lnt"&gt;6
&lt;/span&gt;&lt;span class="lnt"&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class="lntd"&gt;
&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 安装&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install sglang
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# 启动&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;python -m sglang.launch_server &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --model-path Qwen/Qwen3-30B-A3B &lt;span class="se"&gt;\
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; --quantization awq
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;SGLang 对工具调用和结构化输出有专门优化，如果你在做 AI Agent 开发，值得试试。&lt;/p&gt;
&lt;h2 id="结论消费级显卡本地部署的理性预期"&gt;结论：消费级显卡本地部署的理性预期
&lt;/h2&gt;&lt;p&gt;一张 4090 能跑的国产大模型，比 2025 年多了不少，但别指望能跑旗舰。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;值得本地跑的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;日常对话、写作辅助（Qwen3-30B-A3B 足够）&lt;/li&gt;
&lt;li&gt;编程辅助（30B-A3B 或 32B，取决于代码复杂度）&lt;/li&gt;
&lt;li&gt;隐私敏感任务（不能把数据发到云端）&lt;/li&gt;
&lt;li&gt;高频调用（API 按 token 计费，高频场景本地更划算）&lt;/li&gt;
&lt;li&gt;学习和实验（理解模型推理过程）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;用 API 更划算的场景&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要最强模型能力（GLM-5.2、DeepSeek V4 旗舰版）&lt;/li&gt;
&lt;li&gt;低频使用（偶尔用一次，不值得买显卡）&lt;/li&gt;
&lt;li&gt;多模态任务（图像、语音理解，本地模型支持有限）&lt;/li&gt;
&lt;li&gt;长上下文（本地模型上下文窗口通常 8K-32K，API 可以 128K+）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;2026 年的现实是：MoE 架构让消费级显卡也能跑「够用」的大模型，但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合，别被 GLM-5.2 的参数量迷了眼。&lt;/p&gt;
&lt;p&gt;作者：varkm&lt;/p&gt;</description></item><item><title>GLM-5.2编程能力实测：首次逼平Claude Opus，成本只有1/5</title><link>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</link><pubDate>Thu, 16 Jul 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</guid><description>&lt;p&gt;智谱AI 6月13日发布的GLM-5.2，在多个长程编程基准上逼近甚至超越Claude Opus——benchmark数据就摆在那里，不需要我多说。结论是：&lt;strong&gt;国产模型的编程能力，第一次真正追到了Claude Opus的身位。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="glm-52-是什么"&gt;GLM-5.2 是什么
&lt;/h2&gt;&lt;p&gt;先给一张基础参数表：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;发布方&lt;/td&gt;
					&lt;td&gt;智谱AI (Z.ai)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026年6月13日&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;744B MoE，每次推理激活约40B参数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;训练数据&lt;/td&gt;
					&lt;td&gt;28.5万亿 tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;100万 token（Solid 1M 无损）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;MIT，Hugging Face 可下载&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;API 接入&lt;/td&gt;
					&lt;td&gt;bigmodel.cn、WaveSpeed&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个关键点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;MoE架构&lt;/strong&gt;：744B总参数，但每次推理只激活约5%（40B），推理成本远低于同规模Dense模型&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;100万token上下文&lt;/strong&gt;：不是简单扩窗口，是针对长程编程场景数月强化训练的结果&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MIT开源&lt;/strong&gt;：权重可下载可商用，这在同级别模型中非常少见&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="编程能力数据说话"&gt;编程能力：数据说话
&lt;/h2&gt;&lt;p&gt;直接上benchmark，不讲虚的。&lt;/p&gt;
&lt;h3 id="核心基准对比"&gt;核心基准对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;基准&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.1&lt;/th&gt;
					&lt;th&gt;提升&lt;/th&gt;
					&lt;th&gt;说明&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 2.1&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;81.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;62.0&lt;/td&gt;
					&lt;td&gt;+30.6%&lt;/td&gt;
					&lt;td&gt;终端操作能力，长程任务核心指标&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;62.1&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;58.4&lt;/td&gt;
					&lt;td&gt;+6.3%&lt;/td&gt;
					&lt;td&gt;真实软件工程问题修复&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Terminal-Bench从62跳到81，提升30.6%——这个跨度在模型版本迭代中相当少见。&lt;/p&gt;
&lt;h3 id="与顶级模型的横向对比"&gt;与顶级模型的横向对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;GLM-5.2表现&lt;/th&gt;
					&lt;th&gt;来源&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;CodeV3评测&lt;/td&gt;
					&lt;td&gt;全球第三&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CyberGym&lt;/td&gt;
					&lt;td&gt;超越Claude Opus 4.6&lt;/td&gt;
					&lt;td&gt;第三方评测&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;BrowseComp&lt;/td&gt;
					&lt;td&gt;全模型第一（GLM-5系列）&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多个长程编程基准&lt;/td&gt;
					&lt;td&gt;超越GPT-5.5，成本仅1/6&lt;/td&gt;
					&lt;td&gt;VentureBeat评测&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最关键的：&lt;strong&gt;GLM-5.2的编程能力位于Claude Opus 4.7和4.8之间。&lt;/strong&gt; 国产模型在编程能力上追到了世界顶级水平。&lt;/p&gt;
&lt;p&gt;注意，这不是&amp;quot;某个单项超越&amp;quot;的障眼法。长程编程任务需要模型在数十步甚至上百步操作中保持一致性——这才是真正的硬功夫。&lt;/p&gt;
&lt;h2 id="为什么突然这么强"&gt;为什么突然这么强
&lt;/h2&gt;&lt;p&gt;GLM-5.2的编程能力跃升不是偶然，背后有几个关键技术突破。&lt;/p&gt;
&lt;h3 id="1-effort-level-思考档位"&gt;1. Effort Level 思考档位
&lt;/h3&gt;&lt;p&gt;模型可以根据任务复杂度自动调节思考深度。简单问题快速响应，复杂编程任务深度推理。这比固定思维链长度更高效，也更省token。&lt;/p&gt;
&lt;h3 id="2-训练方法升级"&gt;2. 训练方法升级
&lt;/h3&gt;&lt;p&gt;从group-wise优化转向基于critic的PPO，使用token-level advantage适配不等长输出。说人话就是：模型在训练时学会了&amp;quot;在哪些token上多花心思&amp;quot;，而不是均匀分配注意力。&lt;/p&gt;
&lt;h3 id="3-长程编程专项强化"&gt;3. 长程编程专项强化
&lt;/h3&gt;&lt;p&gt;智谱针对长程Coding场景做了数月的强化训练，覆盖大规模代码实现、自动化研究、性能优化等高价值任务。100万token的上下文不是&amp;quot;能塞进去&amp;quot;就行，而是&amp;quot;塞进去之后还能正确理解和操作&amp;quot;。&lt;/p&gt;
&lt;h2 id="成本与性价比"&gt;成本与性价比
&lt;/h2&gt;&lt;p&gt;性能追上了，价格呢？&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Claude Opus&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;API定价&lt;/td&gt;
					&lt;td&gt;显著更低&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;单任务成本（长程编程）&lt;/td&gt;
					&lt;td&gt;约1/5~1/6&lt;/td&gt;
					&lt;td&gt;基准&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源可用&lt;/td&gt;
					&lt;td&gt;✅ MIT&lt;/td&gt;
					&lt;td&gt;❌ 闭源&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;VentureBeat的评测显示，在多个长程编程基准上GLM-5.2超越GPT-5.5，成本仅1/6。对比Claude Opus，成本优势同样显著。&lt;/p&gt;
&lt;p&gt;MIT开源意味着如果有足够算力，完全可以本地部署，彻底消除API成本。这对企业用户和研究者来说是一个重要优势。&lt;/p&gt;
&lt;h2 id="生态不只是一个模型"&gt;生态：不只是一个模型
&lt;/h2&gt;&lt;p&gt;GLM-5.2不是孤军作战，智谱围绕它搭了一整套工具链。&lt;/p&gt;
&lt;h3 id="zcode-30"&gt;ZCode 3.0
&lt;/h3&gt;&lt;p&gt;智谱官方AI编程工具，深度适配GLM-5.2。相比通用API调用，ZCode对编程场景做了专门优化，包括代码补全、重构建议、调试辅助等。&lt;/p&gt;
&lt;h3 id="autoclaw澳龙"&gt;AutoClaw（澳龙）
&lt;/h3&gt;&lt;p&gt;国内首款一键安装的本地客户端，内置50+ Skills，降低使用门槛。不用折腾环境配置，装上就能用。&lt;/p&gt;
&lt;h3 id="coding-plan-订阅制"&gt;Coding Plan 订阅制
&lt;/h3&gt;&lt;p&gt;覆盖四个层级：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;层级&lt;/th&gt;
					&lt;th&gt;定位&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Lite&lt;/td&gt;
					&lt;td&gt;轻度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Pro&lt;/td&gt;
					&lt;td&gt;专业开发者&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Max&lt;/td&gt;
					&lt;td&gt;重度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;团队版&lt;/td&gt;
					&lt;td&gt;企业协作&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;存量用户已全量开放。&lt;/p&gt;
&lt;h2 id="谁该用怎么用"&gt;谁该用、怎么用
&lt;/h2&gt;&lt;h3 id="适合场景"&gt;适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;长程编程任务&lt;/strong&gt;：需要数十步操作的复杂项目，GLM-5.2的100万上下文和长程强化训练是核心优势&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;代码重构&lt;/strong&gt;：大范围代码改造，需要理解整个项目结构&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;自动化研究&lt;/strong&gt;：代码分析、技术调研、文档生成&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="不适合场景"&gt;不适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;简单问答&lt;/strong&gt;：问个语法问题、查个API用法，杀鸡用牛刀了&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;纯对话&lt;/strong&gt;：GLM-5.2的核心优势在编程，日常聊天不需要这个级别的模型&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="使用建议"&gt;使用建议
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;有编程需求的开发者&lt;/strong&gt;，长程任务是GLM-5.2的主场&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;企业用户&lt;/strong&gt;，同等质量的输出，成本可能只有竞品的1/5&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;研究者&lt;/strong&gt;，可下载可商用，这个价位的开源模型非常稀缺&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;GLM-5.2是国产大模型在编程能力上的一次突破。Terminal-Bench 81分、超越Claude Opus 4.6、MIT开源、成本仅1/5——这些数字放在一起，指向一个清晰的结论：&lt;strong&gt;国产模型的编程能力进入了顶级水平。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;它不完美，也不可能取代所有场景。但对于长程编程、代码重构、自动化研究这些高价值任务，GLM-5.2已经是一个值得考虑的选项。&lt;/p&gt;</description></item><item><title>每天300万token免费：ZCode 3.0能否平替Claude Code</title><link>https://blog.kalend.top/2026/07/15/2026-07-15-zcode-vs-claude-code.html/</link><pubDate>Wed, 15 Jul 2026 08:39:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/15/2026-07-15-zcode-vs-claude-code.html/</guid><description>&lt;p&gt;先说结论：ZCode 3.0 不是 Claude Code 的完全平替，但如果你每月预算不到100块、网络条件一般、主要写中文项目——它是目前最值得试的国产方案。&lt;/p&gt;
&lt;p&gt;每天500万免费token，这个数字确实能让人停下来认真看一看。&lt;/p&gt;
&lt;h2 id="zcode-30-是什么"&gt;ZCode 3.0 是什么
&lt;/h2&gt;&lt;p&gt;ZCode 是智谱推出的 ADE（Agentic Development Environment），和 Cursor、Claude Code 是同类产品，但走了一条不同的路：不做纯命令行，而是桌面端可视化操作。深度适配自研的 GLM-5.2 模型，Agent 内核也是自研的。&lt;/p&gt;
&lt;p&gt;简单说：它是一个有图形界面的AI编程工具，不是终端里敲命令的那种。&lt;/p&gt;
&lt;h2 id="免费政策到底能白嫖多少"&gt;免费政策：到底能白嫖多少
&lt;/h2&gt;&lt;p&gt;这是最吸引人的部分，直接上数字：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;额度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;每天300万token&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5-Turbo&lt;/td&gt;
					&lt;td&gt;每天200万token&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;合计&lt;/td&gt;
					&lt;td&gt;每天500万token&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;有效期&lt;/td&gt;
					&lt;td&gt;首次使用起5天&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;清零规则&lt;/td&gt;
					&lt;td&gt;每日0点清零，不累计&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;前置条件&lt;/td&gt;
					&lt;td&gt;不需要先订阅Coding Plan&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;5天免费期过后，需要订阅 GLM Coding Plan：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;套餐&lt;/th&gt;
					&lt;th&gt;月价&lt;/th&gt;
					&lt;th&gt;包含模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Lite&lt;/td&gt;
					&lt;td&gt;¥49&lt;/td&gt;
					&lt;td&gt;GLM-5.2、GLM-5.1、GLM-5-Turbo&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Pro&lt;/td&gt;
					&lt;td&gt;~¥199&lt;/td&gt;
					&lt;td&gt;更高额度&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Max&lt;/td&gt;
					&lt;td&gt;~¥499&lt;/td&gt;
					&lt;td&gt;顶配&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对比 Claude Code：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;方案&lt;/th&gt;
					&lt;th&gt;月价&lt;/th&gt;
					&lt;th&gt;备注&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Pro&lt;/td&gt;
					&lt;td&gt;$20（约¥135）&lt;/td&gt;
					&lt;td&gt;5小时窗口限额&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Max&lt;/td&gt;
					&lt;td&gt;$100-200（约¥675-1350）&lt;/td&gt;
					&lt;td&gt;更高额度&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;光看价格，ZCode Lite 的 ¥49 比 Claude Code Pro 的 ¥135 便宜了近三分之二。而且免费期那5天，每天500万token，足够你认真体验完再决定。&lt;/p&gt;
&lt;h2 id="功能对比可视化-vs-命令行"&gt;功能对比：可视化 vs 命令行
&lt;/h2&gt;&lt;p&gt;ZCode 和 Claude Code 最大的体感差异在于交互方式。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Claude Code&lt;/strong&gt; 是纯命令行，终端里敲命令、看输出。对习惯了终端的开发者来说没问题，但对新手或者喜欢可视化的开发者来说，门槛不低。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;ZCode&lt;/strong&gt; 是桌面端 GUI，有文件树、对话窗口、代码预览，操作更直观。&lt;/p&gt;
&lt;p&gt;核心功能对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;功能&lt;/th&gt;
					&lt;th&gt;ZCode 3.0&lt;/th&gt;
					&lt;th&gt;Claude Code&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;交互方式&lt;/td&gt;
					&lt;td&gt;桌面端GUI&lt;/td&gt;
					&lt;td&gt;命令行CLI&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多Agent协作&lt;/td&gt;
					&lt;td&gt;支持&lt;/td&gt;
					&lt;td&gt;有限支持&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;会话迁移&lt;/td&gt;
					&lt;td&gt;一键导入Claude Code/Codex/OpenCode历史&lt;/td&gt;
					&lt;td&gt;无&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开发流程&lt;/td&gt;
					&lt;td&gt;需求→计划→代码→验证，同一上下文&lt;/td&gt;
					&lt;td&gt;类似，但依赖终端操作&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;模型绑定&lt;/td&gt;
					&lt;td&gt;GLM-5.2（不可换）&lt;/td&gt;
					&lt;td&gt;Claude系列&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;会话迁移是个亮点。ZCode 可以自动扫描本地 Claude Code、Codex、OpenCode 的工作区，把会话历史一键导入。有团队实测十几个项目、近百个会话当天下午全部导入完成。这降低了切换成本。&lt;/p&gt;
&lt;h2 id="glm-52-到底行不行"&gt;GLM-5.2 到底行不行
&lt;/h2&gt;&lt;p&gt;模型能力是核心问题。ZCode 绑定了 GLM-5.2，你没得选，所以这个模型的水平直接决定了工具的上限。&lt;/p&gt;
&lt;p&gt;GLM-5.2 的参数：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;指标&lt;/th&gt;
					&lt;th&gt;数值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;总参数&lt;/td&gt;
					&lt;td&gt;745B（MoE）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;激活参数&lt;/td&gt;
					&lt;td&gt;440B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;1M（无损）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;协议&lt;/td&gt;
					&lt;td&gt;MIT开源&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;它针对长程 Coding Agent 场景做了强化训练，支持大规模代码实现、自动化研究、性能优化。&lt;/p&gt;
&lt;p&gt;知乎用户实测反馈：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;发布当天凌晨，丝般顺滑，缓存命中 98-99%&lt;/li&gt;
&lt;li&gt;第二天白天开始卡，第三天限制并发&lt;/li&gt;
&lt;li&gt;&amp;ldquo;功能层面 ZCode 没有什么独占的东西，不用特意切换&amp;rdquo;&lt;/li&gt;
&lt;li&gt;&amp;ldquo;如果你一直被账号和网络问题折腾，或者想试试国产，值得试&amp;rdquo;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;和 Claude Opus 相比，GLM-5.2 在复杂推理和长链路代码生成上还有差距，但这个差距在缩小。日常的CRUD、重构、文档生成这些场景，GLM-5.2 完全够用。&lt;/p&gt;
&lt;h2 id="国内-coding-plan-现状"&gt;国内 Coding Plan 现状
&lt;/h2&gt;&lt;p&gt;ZCode 不是孤军奋战。国内 Coding Plan 选择已经不少了。&lt;/p&gt;
&lt;p&gt;根据 coding.mcppla.net 2026年7月数据，21家平台横评：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;平台&lt;/th&gt;
					&lt;th&gt;最低月价&lt;/th&gt;
					&lt;th&gt;特点&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;联通云元景&lt;/td&gt;
					&lt;td&gt;¥15&lt;/td&gt;
					&lt;td&gt;最便宜&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;讯飞星辰&lt;/td&gt;
					&lt;td&gt;¥19&lt;/td&gt;
					&lt;td&gt;多模型&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;腾讯云Hy&lt;/td&gt;
					&lt;td&gt;¥28&lt;/td&gt;
					&lt;td&gt;Token计费&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;火山方舟&lt;/td&gt;
					&lt;td&gt;¥40&lt;/td&gt;
					&lt;td&gt;字节系&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;华为云码道&lt;/td&gt;
					&lt;td&gt;¥39&lt;/td&gt;
					&lt;td&gt;鸿蒙模型&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM Coding Plan&lt;/td&gt;
					&lt;td&gt;¥49&lt;/td&gt;
					&lt;td&gt;智谱原生&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi Code Plan&lt;/td&gt;
					&lt;td&gt;¥49&lt;/td&gt;
					&lt;td&gt;月之暗面&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;MiniMax&lt;/td&gt;
					&lt;td&gt;¥49&lt;/td&gt;
					&lt;td&gt;M3全模态&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Cursor&lt;/td&gt;
					&lt;td&gt;¥135&lt;/td&gt;
					&lt;td&gt;IDE&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;平均月付 ¥63.4，大部分支持 Claude Code 客户端通过 OpenAI 兼容接口接入。&lt;/p&gt;
&lt;p&gt;这意味着即使不用 ZCode，你也可以用国内 Coding Plan 喂 Claude Code，把成本从 ¥135 降到 ¥40-49。只是 ZCode 把这条路走得更彻底——连客户端都替你换了。&lt;/p&gt;
&lt;h2 id="真实体验优点和局限"&gt;真实体验：优点和局限
&lt;/h2&gt;&lt;p&gt;用了几天后的真实感受。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;优点：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;免费额度大，5天500万token足够认真体验&lt;/li&gt;
&lt;li&gt;中文理解好，中文注释、中文需求的处理比Claude自然&lt;/li&gt;
&lt;li&gt;无网络限制，直连不卡&lt;/li&gt;
&lt;li&gt;会话迁移方便，切换成本低&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;局限：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;生态封闭，只能用GLM-5.2，不能换模型&lt;/li&gt;
&lt;li&gt;3天后开始限并发，高峰期会排队&lt;/li&gt;
&lt;li&gt;国际社区支持弱，英文文档和StackOverflow生态几乎没有&lt;/li&gt;
&lt;li&gt;和Claude Code相比，复杂推理场景还是差一截&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;知乎上有句评价说得很准：&amp;ldquo;功能层面没有什么独占的东西。&amp;rdquo; ZCode 的核心卖点是成本低、无网络限制。&lt;/p&gt;
&lt;h2 id="结论谁该切换"&gt;结论：谁该切换
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;适合切换的人：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;预算敏感，每月不想花超过100块&lt;/li&gt;
&lt;li&gt;网络条件一般，用Claude Code经常断连&lt;/li&gt;
&lt;li&gt;主要写中文项目，需要好的中文理解&lt;/li&gt;
&lt;li&gt;想试试国产方案，不想被单一厂商锁定&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;不建议切换的人：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;已经深度依赖Claude生态，迁移成本高&lt;/li&gt;
&lt;li&gt;工作场景需要顶级推理能力（复杂架构设计、大规模重构）&lt;/li&gt;
&lt;li&gt;团队已经围绕Claude Code建立了工作流&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;ZCode 3.0 更像 Claude Code 的平价替代品。选工具其实就是看模型、价格、网络哪个对你更重要。&lt;/p&gt;
&lt;p&gt;如果你正好在这个平衡点上，ZCode 值得认真试一试。反正5天免费，不试白不试。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;var km&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>