智谱AI 6月13日发布的GLM-5.2,在多个长程编程基准上逼近甚至超越Claude Opus——benchmark数据就摆在那里,不需要我多说。结论是:国产模型的编程能力,第一次真正追到了Claude Opus的身位。
GLM-5.2 是什么
先给一张基础参数表:
| 参数 | 值 |
|---|---|
| 发布方 | 智谱AI (Z.ai) |
| 发布日期 | 2026年6月13日 |
| 架构 | 744B MoE,每次推理激活约40B参数 |
| 训练数据 | 28.5万亿 tokens |
| 上下文窗口 | 100万 token(Solid 1M 无损) |
| 开源协议 | MIT,Hugging Face 可下载 |
| API 接入 | bigmodel.cn、WaveSpeed |
几个关键点:
- MoE架构:744B总参数,但每次推理只激活约5%(40B),推理成本远低于同规模Dense模型
- 100万token上下文:不是简单扩窗口,是针对长程编程场景数月强化训练的结果
- MIT开源:权重可下载可商用,这在同级别模型中非常少见
编程能力:数据说话
直接上benchmark,不讲虚的。
核心基准对比
| 基准 | GLM-5.2 | GLM-5.1 | 提升 | 说明 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 62.0 | +30.6% | 终端操作能力,长程任务核心指标 |
| SWE-bench Pro | 62.1 | 58.4 | +6.3% | 真实软件工程问题修复 |
Terminal-Bench从62跳到81,提升30.6%——这个跨度在模型版本迭代中相当少见。
与顶级模型的横向对比
| 维度 | GLM-5.2表现 | 来源 |
|---|---|---|
| CodeV3评测 | 全球第三 | 智谱官方 |
| CyberGym | 超越Claude Opus 4.6 | 第三方评测 |
| BrowseComp | 全模型第一(GLM-5系列) | 智谱官方 |
| 多个长程编程基准 | 超越GPT-5.5,成本仅1/6 | VentureBeat评测 |
最关键的:GLM-5.2的编程能力位于Claude Opus 4.7和4.8之间。 国产模型在编程能力上追到了世界顶级水平。
注意,这不是"某个单项超越"的障眼法。长程编程任务需要模型在数十步甚至上百步操作中保持一致性——这才是真正的硬功夫。
为什么突然这么强
GLM-5.2的编程能力跃升不是偶然,背后有几个关键技术突破。
1. Effort Level 思考档位
模型可以根据任务复杂度自动调节思考深度。简单问题快速响应,复杂编程任务深度推理。这比固定思维链长度更高效,也更省token。
2. 训练方法升级
从group-wise优化转向基于critic的PPO,使用token-level advantage适配不等长输出。说人话就是:模型在训练时学会了"在哪些token上多花心思",而不是均匀分配注意力。
3. 长程编程专项强化
智谱针对长程Coding场景做了数月的强化训练,覆盖大规模代码实现、自动化研究、性能优化等高价值任务。100万token的上下文不是"能塞进去"就行,而是"塞进去之后还能正确理解和操作"。
成本与性价比
性能追上了,价格呢?
| 对比项 | GLM-5.2 | Claude Opus |
|---|---|---|
| API定价 | 显著更低 | 高 |
| 单任务成本(长程编程) | 约1/5~1/6 | 基准 |
| 开源可用 | ✅ MIT | ❌ 闭源 |
VentureBeat的评测显示,在多个长程编程基准上GLM-5.2超越GPT-5.5,成本仅1/6。对比Claude Opus,成本优势同样显著。
MIT开源意味着如果有足够算力,完全可以本地部署,彻底消除API成本。这对企业用户和研究者来说是一个重要优势。
生态:不只是一个模型
GLM-5.2不是孤军作战,智谱围绕它搭了一整套工具链。
ZCode 3.0
智谱官方AI编程工具,深度适配GLM-5.2。相比通用API调用,ZCode对编程场景做了专门优化,包括代码补全、重构建议、调试辅助等。
AutoClaw(澳龙)
国内首款一键安装的本地客户端,内置50+ Skills,降低使用门槛。不用折腾环境配置,装上就能用。
Coding Plan 订阅制
覆盖四个层级:
| 层级 | 定位 |
|---|---|
| Lite | 轻度使用 |
| Pro | 专业开发者 |
| Max | 重度使用 |
| 团队版 | 企业协作 |
存量用户已全量开放。
谁该用、怎么用
适合场景
- 长程编程任务:需要数十步操作的复杂项目,GLM-5.2的100万上下文和长程强化训练是核心优势
- 代码重构:大范围代码改造,需要理解整个项目结构
- 自动化研究:代码分析、技术调研、文档生成
不适合场景
- 简单问答:问个语法问题、查个API用法,杀鸡用牛刀了
- 纯对话:GLM-5.2的核心优势在编程,日常聊天不需要这个级别的模型
使用建议
- 有编程需求的开发者,长程任务是GLM-5.2的主场
- 企业用户,同等质量的输出,成本可能只有竞品的1/5
- 研究者,可下载可商用,这个价位的开源模型非常稀缺
结论
GLM-5.2是国产大模型在编程能力上的一次突破。Terminal-Bench 81分、超越Claude Opus 4.6、MIT开源、成本仅1/5——这些数字放在一起,指向一个清晰的结论:国产模型的编程能力进入了顶级水平。
它不完美,也不可能取代所有场景。但对于长程编程、代码重构、自动化研究这些高价值任务,GLM-5.2已经是一个值得考虑的选项。