<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>开源模型 on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 开源模型 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Thu, 30 Jul 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E5%BC%80%E6%BA%90%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>Kimi K3 实测：2.8万亿参数开源模型，能打Claude Opus吗？</title><link>https://blog.kalend.top/2026/07/30/2026-07-30-kimi-k3-review.html/</link><pubDate>Thu, 30 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/30/2026-07-30-kimi-k3-review.html/</guid><description>&lt;p&gt;先说结论：Kimi K3 是国产大模型第一次真正挤进全球第一梯队，值得开发者认真对待。&lt;/p&gt;
&lt;h2 id="waic-2026-的重磅炸弹"&gt;WAIC 2026 的重磅炸弹
&lt;/h2&gt;&lt;p&gt;7月16日，WAIC 2026开幕前夕，月之暗面发布了Kimi K3。2.8万亿参数，开源，Modified MIT许可证。Arena联合创始人直接说这是&amp;quot;今年最重要的一次模型发布&amp;quot;。&lt;/p&gt;
&lt;p&gt;这话不是客套。看数据就知道——Arena Agent榜第4名，和Claude Opus 4.8、GPT-5.6 Sol同分段；Arena前端开发榜直接拿第1，1679分，领先Claude Fable 5整整48分。一个开源模型在编程赛道上把所有闭源选手都压在身下，这在之前从没发生过。&lt;/p&gt;
&lt;p&gt;在此之前，国产模型在全球排行榜上的最好成绩大概是GLM-5.2的&amp;quot;接近Opus水平&amp;quot;。K3直接跳过了&amp;quot;接近&amp;quot;，做到了&amp;quot;并列&amp;quot;。这一步的跨度比很多人想象的要大。&lt;/p&gt;
&lt;h2 id="k3-到底是什么"&gt;K3 到底是什么
&lt;/h2&gt;&lt;p&gt;先理清几个关键参数：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;参数规模&lt;/td&gt;
					&lt;td&gt;2.8万亿（2.8T），MoE架构&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;1,048,576 tokens（1M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多模态&lt;/td&gt;
					&lt;td&gt;原生视觉理解&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;Modified MIT&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026年7月16日&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;2.8T的MoE架构意味着什么？对比一下：DeepSeek V4-Pro是1.6T参数，K3比它大了约75%。但MoE不是全部参数同时激活，每次推理只激活一部分专家网络，所以推理成本和全连接的密集模型不是一个量级。这也是为什么参数量能做到这么大，同时上下文还能撑到100万token——原生支持，不是外挂式扩展。&lt;/p&gt;
&lt;p&gt;MoE架构的核心优势在于&amp;quot;大容量、低成本&amp;quot;。模型可以存储海量知识在参数中，但每次调用只用到其中一小部分。这就像一个图书馆有百万本书，但你每次只需要翻开其中几本。K3把这个思路推到了极致——2.8万亿参数里装的知识密度，理论上应该远超1.6T的DeepSeek V4-Pro。&lt;/p&gt;
&lt;h2 id="跑分开源第一闭源并列"&gt;跑分：开源第一，闭源并列
&lt;/h2&gt;&lt;p&gt;直接上硬数据：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Arena Agent榜&lt;/strong&gt;：第4名，与Claude Opus 4.8和GPT-5.6 Sol同分数段。Arena的Agent榜考的是模型作为自主Agent的能力——给一个复杂任务，模型需要自己规划步骤、调用工具、解决问题。这意味着在通用Agent能力上，K3已经和OpenAI、Anthropic的旗舰模型站在同一台阶。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Arena前端开发榜&lt;/strong&gt;：第1名，1679分。这个榜专门考前端代码生成，K3甩开第二名Claude Fable 5整整48分。Kimi系列从前几代就以前端能力著称，K3把这个优势进一步拉大了。48分的差距在Arena的评分体系里是非常显著的——通常相邻名次之间只差几分。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SWE-bench Pro&lt;/strong&gt;：58.6%，开源模型第一。SWE-bench Pro考的是真实GitHub issue修复能力，给模型一个真实的代码仓库和一个bug报告，看它能不能自己定位问题、写出修复代码。58.6%意味着超过一半的真实软件工程问题它能独立解决。这个数字比很多初级开发者的表现还要好。&lt;/p&gt;
&lt;p&gt;数据来源：Arena排行榜（lmarena.ai）和SWE-bench官方评测。这些数据都是公开可查的，不是厂商自己跑的私有评测。&lt;/p&gt;
&lt;h2 id="开发者视角api和工具链"&gt;开发者视角：API和工具链
&lt;/h2&gt;&lt;p&gt;光跑分好看没用，开发者关心的是能不能直接上手。K3在这方面做了不少功课。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;API定价&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;类型&lt;/th&gt;
					&lt;th&gt;价格&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;输入（cache miss）&lt;/td&gt;
					&lt;td&gt;$3.00/M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入（cache hit）&lt;/td&gt;
					&lt;td&gt;$0.30/M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输出&lt;/td&gt;
					&lt;td&gt;$15.00/M tokens&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对比Claude Opus 4.8的输入$15/M，K3的输入价格只有它的五分之一。cache命中时更是低到$0.30/M——根据月之暗面官方数据，编码场景的缓存命中率可以超过90%，实际成本会非常低。&lt;/p&gt;
&lt;p&gt;举个具体例子：假设你用K3写一个中等复杂度的代码生成任务，输入2000 tokens、输出5000 tokens，cache命中时一次调用成本约$0.076。同样的任务用Opus 4.8，成本约$0.105，贵了38%。如果是高频调用的Agent场景，这个差距会被放大到几倍甚至十几倍。&lt;/p&gt;
&lt;p&gt;API接入方式很标准：&lt;code&gt;https://api.moonshot.ai/v1&lt;/code&gt;，模型ID &lt;code&gt;kimi-k3&lt;/code&gt;，兼容OpenAI SDK格式。这意味着如果你之前用OpenAI的SDK写代码，只需要改一下base_url和api_key就能切换到K3。OpenRouter上也能用，地址是&lt;code&gt;openrouter.ai/moonshotai/kimi-k3&lt;/code&gt;，适合想先试用再决定的开发者。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;配套工具方面&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Kimi Code&lt;/strong&gt;：官方编程工具，支持Swarm多Agent并行模式。Swarm是K3的原生特性，可以同时启动多个Agent协作完成复杂任务，这在其他模型上通常需要自己搭建编排框架&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Goal长程任务&lt;/strong&gt;：官方演示了48小时连续自主运行完成芯片设计的案例。这种长时间自主执行能力对需要持续迭代的工程任务很有价值，比如大型代码重构、数据分析流水线&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Tool Calling&lt;/strong&gt;：支持标准工具调用，可接入Cursor、Continue等第三方IDE工具。对于已经习惯在IDE里用AI辅助编程的开发者，切换成本很低&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要注意的是，要使用完整的100万token上下文，需要在配置中手动设置context window为1048576，否则可能只用到默认的较短上下文。这个坑我在测试时踩过——一开始只用了默认配置，结果发现长文档处理能力远不如预期，后来才发现是没有用满上下文窗口。&lt;/p&gt;
&lt;h2 id="与竞品的正面交锋"&gt;与竞品的正面交锋
&lt;/h2&gt;&lt;p&gt;把几个主流模型拉到一起比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;上下文&lt;/th&gt;
					&lt;th&gt;API输入价格&lt;/th&gt;
					&lt;th&gt;编程排名&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;2.8T&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;$3/M&lt;/td&gt;
					&lt;td&gt;Arena前端#1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Opus 4.8&lt;/td&gt;
					&lt;td&gt;未公开&lt;/td&gt;
					&lt;td&gt;200K&lt;/td&gt;
					&lt;td&gt;$15/M&lt;/td&gt;
					&lt;td&gt;Agent#4同级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
					&lt;td&gt;未公开&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
					&lt;td&gt;$5/M&lt;/td&gt;
					&lt;td&gt;Agent#4同级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V4-Pro&lt;/td&gt;
					&lt;td&gt;1.6T&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;¥2/M&lt;/td&gt;
					&lt;td&gt;较低&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;745B MoE&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;¥5/M&lt;/td&gt;
					&lt;td&gt;接近Opus&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个观察：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;上下文领先&lt;/strong&gt;：1M上下文与DeepSeek V4-Pro、GLM-5.2同级，但远超Claude的200K和GPT的128K。处理超长文档、代码库分析时优势明显。比如分析一个10万行的代码库，K3可以一次塞进去，其他模型要么分段要么丢上下文。在实际开发中，这意味着你可以把整个项目的代码一次性喂给K3，让它理解全局架构后再做修改，而不是每次只能给它看一个文件。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;价格优势明显&lt;/strong&gt;：输入价格只有Opus的1/5，GPT-5.6的60%。加上缓存命中率，实际使用成本更低。对于创业公司和个人开发者来说，这个价格差距可能决定了能不能在预算内完成项目。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;开源是杀手锏&lt;/strong&gt;：Modified MIT协议意味着可以商用、可以微调、可以本地部署。闭源模型做不到这一点。对于有数据安全要求的企业，这一点可能比跑分更重要——你的代码和数据不需要发送到外部API。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;DeepSeek价格更低&lt;/strong&gt;：如果纯看成本，DeepSeek V4-Pro的¥2/M仍然更便宜，但能力和K3不在一个量级。选DeepSeek还是K3，本质上是&amp;quot;够用就好&amp;quot;和&amp;quot;追求最好&amp;quot;的区别。&lt;/p&gt;
&lt;h2 id="实际使用建议"&gt;实际使用建议
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;什么场景适合用K3？&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要处理超长上下文的任务（法律文档、代码库分析、长对话）&lt;/li&gt;
&lt;li&gt;前端代码生成（排行榜第一不是白给的）&lt;/li&gt;
&lt;li&gt;需要开源协议的商业项目&lt;/li&gt;
&lt;li&gt;成本敏感但对能力有要求的场景&lt;/li&gt;
&lt;li&gt;多Agent协作任务（Swarm模式是原生支持的）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;什么场景可能还是Opus/GPT更好？&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要极强推理能力的复杂逻辑任务（Arena Agent榜Opus和K3同分，但细分维度可能有差异）&lt;/li&gt;
&lt;li&gt;已经深度集成Claude/GPT生态的项目，切换成本高&lt;/li&gt;
&lt;li&gt;需要Claude的超长稳定输出的场景（Opus在长文本生成的稳定性上仍有口碑）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;接入建议&lt;/strong&gt;：先通过OpenRouter试用，验证能力是否满足需求。如果决定深度使用，直接走Moonshot官方API，利用缓存机制降低成本。对于开源部署，需要关注完整权重的发布时间（官方表示7月27日前发布）。&lt;/p&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;Kimi K3的意义不只是&amp;quot;又一个很强的模型&amp;quot;。它是国产开源模型第一次在全球排行榜上和OpenAI、Anthropic的旗舰产品平起平坐。2.8万亿参数、100万上下文、Arena前端第一、SWE-bench开源第一——这些不是PPT上的数字，是可验证的跑分结果。&lt;/p&gt;
&lt;p&gt;对开发者来说，最实际的影响是：你的模型选择菜单里多了一个真正有竞争力的选项。价格比Opus便宜5倍，上下文比GPT和Claude长数倍，还开源。要不要上车取决于你的具体需求，但至少现在值得花一个下午认真试一试。&lt;/p&gt;
&lt;p&gt;月之暗面从Kimi K1到K3的迭代速度很快，每一代都在编程能力上有明显提升。如果这个趋势持续下去，闭源模型的定价策略恐怕要重新考虑了。&lt;/p&gt;</description></item><item><title>GLM-5.2编程能力实测：首次逼平Claude Opus，成本只有1/5</title><link>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</link><pubDate>Thu, 16 Jul 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</guid><description>&lt;p&gt;智谱AI 6月13日发布的GLM-5.2，在多个长程编程基准上逼近甚至超越Claude Opus——benchmark数据就摆在那里，不需要我多说。结论是：&lt;strong&gt;国产模型的编程能力，第一次真正追到了Claude Opus的身位。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="glm-52-是什么"&gt;GLM-5.2 是什么
&lt;/h2&gt;&lt;p&gt;先给一张基础参数表：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;发布方&lt;/td&gt;
					&lt;td&gt;智谱AI (Z.ai)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026年6月13日&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;744B MoE，每次推理激活约40B参数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;训练数据&lt;/td&gt;
					&lt;td&gt;28.5万亿 tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;100万 token（Solid 1M 无损）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;MIT，Hugging Face 可下载&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;API 接入&lt;/td&gt;
					&lt;td&gt;bigmodel.cn、WaveSpeed&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个关键点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;MoE架构&lt;/strong&gt;：744B总参数，但每次推理只激活约5%（40B），推理成本远低于同规模Dense模型&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;100万token上下文&lt;/strong&gt;：不是简单扩窗口，是针对长程编程场景数月强化训练的结果&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MIT开源&lt;/strong&gt;：权重可下载可商用，这在同级别模型中非常少见&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="编程能力数据说话"&gt;编程能力：数据说话
&lt;/h2&gt;&lt;p&gt;直接上benchmark，不讲虚的。&lt;/p&gt;
&lt;h3 id="核心基准对比"&gt;核心基准对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;基准&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.1&lt;/th&gt;
					&lt;th&gt;提升&lt;/th&gt;
					&lt;th&gt;说明&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 2.1&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;81.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;62.0&lt;/td&gt;
					&lt;td&gt;+30.6%&lt;/td&gt;
					&lt;td&gt;终端操作能力，长程任务核心指标&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;62.1&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;58.4&lt;/td&gt;
					&lt;td&gt;+6.3%&lt;/td&gt;
					&lt;td&gt;真实软件工程问题修复&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Terminal-Bench从62跳到81，提升30.6%——这个跨度在模型版本迭代中相当少见。&lt;/p&gt;
&lt;h3 id="与顶级模型的横向对比"&gt;与顶级模型的横向对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;GLM-5.2表现&lt;/th&gt;
					&lt;th&gt;来源&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;CodeV3评测&lt;/td&gt;
					&lt;td&gt;全球第三&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CyberGym&lt;/td&gt;
					&lt;td&gt;超越Claude Opus 4.6&lt;/td&gt;
					&lt;td&gt;第三方评测&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;BrowseComp&lt;/td&gt;
					&lt;td&gt;全模型第一（GLM-5系列）&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多个长程编程基准&lt;/td&gt;
					&lt;td&gt;超越GPT-5.5，成本仅1/6&lt;/td&gt;
					&lt;td&gt;VentureBeat评测&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最关键的：&lt;strong&gt;GLM-5.2的编程能力位于Claude Opus 4.7和4.8之间。&lt;/strong&gt; 国产模型在编程能力上追到了世界顶级水平。&lt;/p&gt;
&lt;p&gt;注意，这不是&amp;quot;某个单项超越&amp;quot;的障眼法。长程编程任务需要模型在数十步甚至上百步操作中保持一致性——这才是真正的硬功夫。&lt;/p&gt;
&lt;h2 id="为什么突然这么强"&gt;为什么突然这么强
&lt;/h2&gt;&lt;p&gt;GLM-5.2的编程能力跃升不是偶然，背后有几个关键技术突破。&lt;/p&gt;
&lt;h3 id="1-effort-level-思考档位"&gt;1. Effort Level 思考档位
&lt;/h3&gt;&lt;p&gt;模型可以根据任务复杂度自动调节思考深度。简单问题快速响应，复杂编程任务深度推理。这比固定思维链长度更高效，也更省token。&lt;/p&gt;
&lt;h3 id="2-训练方法升级"&gt;2. 训练方法升级
&lt;/h3&gt;&lt;p&gt;从group-wise优化转向基于critic的PPO，使用token-level advantage适配不等长输出。说人话就是：模型在训练时学会了&amp;quot;在哪些token上多花心思&amp;quot;，而不是均匀分配注意力。&lt;/p&gt;
&lt;h3 id="3-长程编程专项强化"&gt;3. 长程编程专项强化
&lt;/h3&gt;&lt;p&gt;智谱针对长程Coding场景做了数月的强化训练，覆盖大规模代码实现、自动化研究、性能优化等高价值任务。100万token的上下文不是&amp;quot;能塞进去&amp;quot;就行，而是&amp;quot;塞进去之后还能正确理解和操作&amp;quot;。&lt;/p&gt;
&lt;h2 id="成本与性价比"&gt;成本与性价比
&lt;/h2&gt;&lt;p&gt;性能追上了，价格呢？&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Claude Opus&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;API定价&lt;/td&gt;
					&lt;td&gt;显著更低&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;单任务成本（长程编程）&lt;/td&gt;
					&lt;td&gt;约1/5~1/6&lt;/td&gt;
					&lt;td&gt;基准&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源可用&lt;/td&gt;
					&lt;td&gt;✅ MIT&lt;/td&gt;
					&lt;td&gt;❌ 闭源&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;VentureBeat的评测显示，在多个长程编程基准上GLM-5.2超越GPT-5.5，成本仅1/6。对比Claude Opus，成本优势同样显著。&lt;/p&gt;
&lt;p&gt;MIT开源意味着如果有足够算力，完全可以本地部署，彻底消除API成本。这对企业用户和研究者来说是一个重要优势。&lt;/p&gt;
&lt;h2 id="生态不只是一个模型"&gt;生态：不只是一个模型
&lt;/h2&gt;&lt;p&gt;GLM-5.2不是孤军作战，智谱围绕它搭了一整套工具链。&lt;/p&gt;
&lt;h3 id="zcode-30"&gt;ZCode 3.0
&lt;/h3&gt;&lt;p&gt;智谱官方AI编程工具，深度适配GLM-5.2。相比通用API调用，ZCode对编程场景做了专门优化，包括代码补全、重构建议、调试辅助等。&lt;/p&gt;
&lt;h3 id="autoclaw澳龙"&gt;AutoClaw（澳龙）
&lt;/h3&gt;&lt;p&gt;国内首款一键安装的本地客户端，内置50+ Skills，降低使用门槛。不用折腾环境配置，装上就能用。&lt;/p&gt;
&lt;h3 id="coding-plan-订阅制"&gt;Coding Plan 订阅制
&lt;/h3&gt;&lt;p&gt;覆盖四个层级：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;层级&lt;/th&gt;
					&lt;th&gt;定位&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Lite&lt;/td&gt;
					&lt;td&gt;轻度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Pro&lt;/td&gt;
					&lt;td&gt;专业开发者&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Max&lt;/td&gt;
					&lt;td&gt;重度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;团队版&lt;/td&gt;
					&lt;td&gt;企业协作&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;存量用户已全量开放。&lt;/p&gt;
&lt;h2 id="谁该用怎么用"&gt;谁该用、怎么用
&lt;/h2&gt;&lt;h3 id="适合场景"&gt;适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;长程编程任务&lt;/strong&gt;：需要数十步操作的复杂项目，GLM-5.2的100万上下文和长程强化训练是核心优势&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;代码重构&lt;/strong&gt;：大范围代码改造，需要理解整个项目结构&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;自动化研究&lt;/strong&gt;：代码分析、技术调研、文档生成&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="不适合场景"&gt;不适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;简单问答&lt;/strong&gt;：问个语法问题、查个API用法，杀鸡用牛刀了&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;纯对话&lt;/strong&gt;：GLM-5.2的核心优势在编程，日常聊天不需要这个级别的模型&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="使用建议"&gt;使用建议
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;有编程需求的开发者&lt;/strong&gt;，长程任务是GLM-5.2的主场&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;企业用户&lt;/strong&gt;，同等质量的输出，成本可能只有竞品的1/5&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;研究者&lt;/strong&gt;，可下载可商用，这个价位的开源模型非常稀缺&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;GLM-5.2是国产大模型在编程能力上的一次突破。Terminal-Bench 81分、超越Claude Opus 4.6、MIT开源、成本仅1/5——这些数字放在一起，指向一个清晰的结论：&lt;strong&gt;国产模型的编程能力进入了顶级水平。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;它不完美，也不可能取代所有场景。但对于长程编程、代码重构、自动化研究这些高价值任务，GLM-5.2已经是一个值得考虑的选项。&lt;/p&gt;</description></item></channel></rss>