<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GLM on Kalend's Blog</title><link>https://blog.kalend.top/categories/glm/</link><description>Recent content in GLM on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Thu, 16 Jul 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/categories/glm/index.xml" rel="self" type="application/rss+xml"/><item><title>GLM-5.2编程能力实测：首次逼平Claude Opus，成本只有1/5</title><link>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</link><pubDate>Thu, 16 Jul 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/16/2026-07-16-glm52-coding-benchmark.html/</guid><description>&lt;p&gt;智谱AI 6月13日发布的GLM-5.2，在多个长程编程基准上逼近甚至超越Claude Opus——benchmark数据就摆在那里，不需要我多说。结论是：&lt;strong&gt;国产模型的编程能力，第一次真正追到了Claude Opus的身位。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="glm-52-是什么"&gt;GLM-5.2 是什么
&lt;/h2&gt;&lt;p&gt;先给一张基础参数表：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;发布方&lt;/td&gt;
					&lt;td&gt;智谱AI (Z.ai)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026年6月13日&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;744B MoE，每次推理激活约40B参数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;训练数据&lt;/td&gt;
					&lt;td&gt;28.5万亿 tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;100万 token（Solid 1M 无损）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;MIT，Hugging Face 可下载&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;API 接入&lt;/td&gt;
					&lt;td&gt;bigmodel.cn、WaveSpeed&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个关键点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;MoE架构&lt;/strong&gt;：744B总参数，但每次推理只激活约5%（40B），推理成本远低于同规模Dense模型&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;100万token上下文&lt;/strong&gt;：不是简单扩窗口，是针对长程编程场景数月强化训练的结果&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;MIT开源&lt;/strong&gt;：权重可下载可商用，这在同级别模型中非常少见&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="编程能力数据说话"&gt;编程能力：数据说话
&lt;/h2&gt;&lt;p&gt;直接上benchmark，不讲虚的。&lt;/p&gt;
&lt;h3 id="核心基准对比"&gt;核心基准对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;基准&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.1&lt;/th&gt;
					&lt;th&gt;提升&lt;/th&gt;
					&lt;th&gt;说明&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 2.1&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;81.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;62.0&lt;/td&gt;
					&lt;td&gt;+30.6%&lt;/td&gt;
					&lt;td&gt;终端操作能力，长程任务核心指标&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;62.1&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;58.4&lt;/td&gt;
					&lt;td&gt;+6.3%&lt;/td&gt;
					&lt;td&gt;真实软件工程问题修复&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Terminal-Bench从62跳到81，提升30.6%——这个跨度在模型版本迭代中相当少见。&lt;/p&gt;
&lt;h3 id="与顶级模型的横向对比"&gt;与顶级模型的横向对比
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;GLM-5.2表现&lt;/th&gt;
					&lt;th&gt;来源&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;CodeV3评测&lt;/td&gt;
					&lt;td&gt;全球第三&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CyberGym&lt;/td&gt;
					&lt;td&gt;超越Claude Opus 4.6&lt;/td&gt;
					&lt;td&gt;第三方评测&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;BrowseComp&lt;/td&gt;
					&lt;td&gt;全模型第一（GLM-5系列）&lt;/td&gt;
					&lt;td&gt;智谱官方&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多个长程编程基准&lt;/td&gt;
					&lt;td&gt;超越GPT-5.5，成本仅1/6&lt;/td&gt;
					&lt;td&gt;VentureBeat评测&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最关键的：&lt;strong&gt;GLM-5.2的编程能力位于Claude Opus 4.7和4.8之间。&lt;/strong&gt; 国产模型在编程能力上追到了世界顶级水平。&lt;/p&gt;
&lt;p&gt;注意，这不是&amp;quot;某个单项超越&amp;quot;的障眼法。长程编程任务需要模型在数十步甚至上百步操作中保持一致性——这才是真正的硬功夫。&lt;/p&gt;
&lt;h2 id="为什么突然这么强"&gt;为什么突然这么强
&lt;/h2&gt;&lt;p&gt;GLM-5.2的编程能力跃升不是偶然，背后有几个关键技术突破。&lt;/p&gt;
&lt;h3 id="1-effort-level-思考档位"&gt;1. Effort Level 思考档位
&lt;/h3&gt;&lt;p&gt;模型可以根据任务复杂度自动调节思考深度。简单问题快速响应，复杂编程任务深度推理。这比固定思维链长度更高效，也更省token。&lt;/p&gt;
&lt;h3 id="2-训练方法升级"&gt;2. 训练方法升级
&lt;/h3&gt;&lt;p&gt;从group-wise优化转向基于critic的PPO，使用token-level advantage适配不等长输出。说人话就是：模型在训练时学会了&amp;quot;在哪些token上多花心思&amp;quot;，而不是均匀分配注意力。&lt;/p&gt;
&lt;h3 id="3-长程编程专项强化"&gt;3. 长程编程专项强化
&lt;/h3&gt;&lt;p&gt;智谱针对长程Coding场景做了数月的强化训练，覆盖大规模代码实现、自动化研究、性能优化等高价值任务。100万token的上下文不是&amp;quot;能塞进去&amp;quot;就行，而是&amp;quot;塞进去之后还能正确理解和操作&amp;quot;。&lt;/p&gt;
&lt;h2 id="成本与性价比"&gt;成本与性价比
&lt;/h2&gt;&lt;p&gt;性能追上了，价格呢？&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比项&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;Claude Opus&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;API定价&lt;/td&gt;
					&lt;td&gt;显著更低&lt;/td&gt;
					&lt;td&gt;高&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;单任务成本（长程编程）&lt;/td&gt;
					&lt;td&gt;约1/5~1/6&lt;/td&gt;
					&lt;td&gt;基准&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源可用&lt;/td&gt;
					&lt;td&gt;✅ MIT&lt;/td&gt;
					&lt;td&gt;❌ 闭源&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;VentureBeat的评测显示，在多个长程编程基准上GLM-5.2超越GPT-5.5，成本仅1/6。对比Claude Opus，成本优势同样显著。&lt;/p&gt;
&lt;p&gt;MIT开源意味着如果有足够算力，完全可以本地部署，彻底消除API成本。这对企业用户和研究者来说是一个重要优势。&lt;/p&gt;
&lt;h2 id="生态不只是一个模型"&gt;生态：不只是一个模型
&lt;/h2&gt;&lt;p&gt;GLM-5.2不是孤军作战，智谱围绕它搭了一整套工具链。&lt;/p&gt;
&lt;h3 id="zcode-30"&gt;ZCode 3.0
&lt;/h3&gt;&lt;p&gt;智谱官方AI编程工具，深度适配GLM-5.2。相比通用API调用，ZCode对编程场景做了专门优化，包括代码补全、重构建议、调试辅助等。&lt;/p&gt;
&lt;h3 id="autoclaw澳龙"&gt;AutoClaw（澳龙）
&lt;/h3&gt;&lt;p&gt;国内首款一键安装的本地客户端，内置50+ Skills，降低使用门槛。不用折腾环境配置，装上就能用。&lt;/p&gt;
&lt;h3 id="coding-plan-订阅制"&gt;Coding Plan 订阅制
&lt;/h3&gt;&lt;p&gt;覆盖四个层级：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;层级&lt;/th&gt;
					&lt;th&gt;定位&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Lite&lt;/td&gt;
					&lt;td&gt;轻度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Pro&lt;/td&gt;
					&lt;td&gt;专业开发者&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Max&lt;/td&gt;
					&lt;td&gt;重度使用&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;团队版&lt;/td&gt;
					&lt;td&gt;企业协作&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;存量用户已全量开放。&lt;/p&gt;
&lt;h2 id="谁该用怎么用"&gt;谁该用、怎么用
&lt;/h2&gt;&lt;h3 id="适合场景"&gt;适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;长程编程任务&lt;/strong&gt;：需要数十步操作的复杂项目，GLM-5.2的100万上下文和长程强化训练是核心优势&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;代码重构&lt;/strong&gt;：大范围代码改造，需要理解整个项目结构&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;自动化研究&lt;/strong&gt;：代码分析、技术调研、文档生成&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="不适合场景"&gt;不适合场景
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;简单问答&lt;/strong&gt;：问个语法问题、查个API用法，杀鸡用牛刀了&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;纯对话&lt;/strong&gt;：GLM-5.2的核心优势在编程，日常聊天不需要这个级别的模型&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="使用建议"&gt;使用建议
&lt;/h3&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;有编程需求的开发者&lt;/strong&gt;，长程任务是GLM-5.2的主场&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;企业用户&lt;/strong&gt;，同等质量的输出，成本可能只有竞品的1/5&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;研究者&lt;/strong&gt;，可下载可商用，这个价位的开源模型非常稀缺&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;GLM-5.2是国产大模型在编程能力上的一次突破。Terminal-Bench 81分、超越Claude Opus 4.6、MIT开源、成本仅1/5——这些数字放在一起，指向一个清晰的结论：&lt;strong&gt;国产模型的编程能力进入了顶级水平。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;它不完美，也不可能取代所有场景。但对于长程编程、代码重构、自动化研究这些高价值任务，GLM-5.2已经是一个值得考虑的选项。&lt;/p&gt;</description></item></channel></rss>