GLM-5.2编程能力实测:首次逼平Claude Opus,成本只有1/5

GLM-5.2编程能力实测:Terminal-Bench 81分逼近Claude Opus,开源MIT协议,成本仅1/5。744B MoE架构+100万token上下文,国产模型编程能力新记录。

智谱AI 6月13日发布的GLM-5.2,在多个长程编程基准上逼近甚至超越Claude Opus——benchmark数据就摆在那里,不需要我多说。结论是:国产模型的编程能力,第一次真正追到了Claude Opus的身位。

GLM-5.2 是什么

先给一张基础参数表:

参数
发布方智谱AI (Z.ai)
发布日期2026年6月13日
架构744B MoE,每次推理激活约40B参数
训练数据28.5万亿 tokens
上下文窗口100万 token(Solid 1M 无损)
开源协议MIT,Hugging Face 可下载
API 接入bigmodel.cn、WaveSpeed

几个关键点:

  • MoE架构:744B总参数,但每次推理只激活约5%(40B),推理成本远低于同规模Dense模型
  • 100万token上下文:不是简单扩窗口,是针对长程编程场景数月强化训练的结果
  • MIT开源:权重可下载可商用,这在同级别模型中非常少见

编程能力:数据说话

直接上benchmark,不讲虚的。

核心基准对比

基准GLM-5.2GLM-5.1提升说明
Terminal-Bench 2.181.062.0+30.6%终端操作能力,长程任务核心指标
SWE-bench Pro62.158.4+6.3%真实软件工程问题修复

Terminal-Bench从62跳到81,提升30.6%——这个跨度在模型版本迭代中相当少见。

与顶级模型的横向对比

维度GLM-5.2表现来源
CodeV3评测全球第三智谱官方
CyberGym超越Claude Opus 4.6第三方评测
BrowseComp全模型第一(GLM-5系列)智谱官方
多个长程编程基准超越GPT-5.5,成本仅1/6VentureBeat评测

最关键的:GLM-5.2的编程能力位于Claude Opus 4.7和4.8之间。 国产模型在编程能力上追到了世界顶级水平。

注意,这不是"某个单项超越"的障眼法。长程编程任务需要模型在数十步甚至上百步操作中保持一致性——这才是真正的硬功夫。

为什么突然这么强

GLM-5.2的编程能力跃升不是偶然,背后有几个关键技术突破。

1. Effort Level 思考档位

模型可以根据任务复杂度自动调节思考深度。简单问题快速响应,复杂编程任务深度推理。这比固定思维链长度更高效,也更省token。

2. 训练方法升级

从group-wise优化转向基于critic的PPO,使用token-level advantage适配不等长输出。说人话就是:模型在训练时学会了"在哪些token上多花心思",而不是均匀分配注意力。

3. 长程编程专项强化

智谱针对长程Coding场景做了数月的强化训练,覆盖大规模代码实现、自动化研究、性能优化等高价值任务。100万token的上下文不是"能塞进去"就行,而是"塞进去之后还能正确理解和操作"。

成本与性价比

性能追上了,价格呢?

对比项GLM-5.2Claude Opus
API定价显著更低
单任务成本(长程编程)约1/5~1/6基准
开源可用✅ MIT❌ 闭源

VentureBeat的评测显示,在多个长程编程基准上GLM-5.2超越GPT-5.5,成本仅1/6。对比Claude Opus,成本优势同样显著。

MIT开源意味着如果有足够算力,完全可以本地部署,彻底消除API成本。这对企业用户和研究者来说是一个重要优势。

生态:不只是一个模型

GLM-5.2不是孤军作战,智谱围绕它搭了一整套工具链。

ZCode 3.0

智谱官方AI编程工具,深度适配GLM-5.2。相比通用API调用,ZCode对编程场景做了专门优化,包括代码补全、重构建议、调试辅助等。

AutoClaw(澳龙)

国内首款一键安装的本地客户端,内置50+ Skills,降低使用门槛。不用折腾环境配置,装上就能用。

Coding Plan 订阅制

覆盖四个层级:

层级定位
Lite轻度使用
Pro专业开发者
Max重度使用
团队版企业协作

存量用户已全量开放。

谁该用、怎么用

适合场景

  • 长程编程任务:需要数十步操作的复杂项目,GLM-5.2的100万上下文和长程强化训练是核心优势
  • 代码重构:大范围代码改造,需要理解整个项目结构
  • 自动化研究:代码分析、技术调研、文档生成

不适合场景

  • 简单问答:问个语法问题、查个API用法,杀鸡用牛刀了
  • 纯对话:GLM-5.2的核心优势在编程,日常聊天不需要这个级别的模型

使用建议

  1. 有编程需求的开发者,长程任务是GLM-5.2的主场
  2. 企业用户,同等质量的输出,成本可能只有竞品的1/5
  3. 研究者,可下载可商用,这个价位的开源模型非常稀缺

结论

GLM-5.2是国产大模型在编程能力上的一次突破。Terminal-Bench 81分、超越Claude Opus 4.6、MIT开源、成本仅1/5——这些数字放在一起,指向一个清晰的结论:国产模型的编程能力进入了顶级水平。

它不完美,也不可能取代所有场景。但对于长程编程、代码重构、自动化研究这些高价值任务,GLM-5.2已经是一个值得考虑的选项。