<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>后训练Scaling on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E5%90%8E%E8%AE%AD%E7%BB%83scaling/</link><description>Recent content in 后训练Scaling on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Fri, 14 Aug 2026 14:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E5%90%8E%E8%AE%AD%E7%BB%83scaling/index.xml" rel="self" type="application/rss+xml"/><item><title>GLM-5.3 今天发布：编程能力暴涨50%，开源模型第一次站上巅峰</title><link>https://blog.kalend.top/2026/08/14/2026-08-14-glm-53-release.html/</link><pubDate>Fri, 14 Aug 2026 14:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/14/2026-08-14-glm-53-release.html/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;今天智谱发布了 GLM-5.3，同一天财联社、每经、IT之家都在报。我第一时间看完技术报告，说一句：&lt;strong&gt;这次不是堆参数，是训练方法论变了。&lt;/strong&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;GLM-5.3 和 GLM-5.2 &lt;strong&gt;同一个底座&lt;/strong&gt;，没换架构、没加参数。纯靠后训练 Scaling，编程能力提升 50%。&lt;/p&gt;
&lt;p&gt;Terminal-Bench 3.0 从 4.6 干到 28.3，&lt;strong&gt;开源模型第一&lt;/strong&gt;。CyberGym 安全评测 83.5%，逼近闭源天花板 Mythos 5 的 83.8%。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;一句话：开源模型在编程赛道，第一次有资格和闭源顶级模型坐在同一张桌子上。&lt;/strong&gt;&lt;/p&gt;
&lt;!-- more --&gt;
&lt;h2 id="什么是后训练-scaling"&gt;什么是&amp;quot;后训练 Scaling&amp;quot;
&lt;/h2&gt;&lt;p&gt;这个词很重要，必须解释清楚。&lt;/p&gt;
&lt;p&gt;传统 Scaling Law 是&lt;strong&gt;堆参数、堆数据、堆算力&lt;/strong&gt;——模型越大越聪明。&lt;/p&gt;
&lt;p&gt;后训练 Scaling 换了个思路：&lt;strong&gt;底座不动，靠更精细的训练策略榨出更多能力。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;GLM-5.3 的做法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练不再局限于孤立编程题&lt;/li&gt;
&lt;li&gt;扩展到&lt;strong&gt;完整工程流程&lt;/strong&gt;：发现问题→分析方案→实施→验证→交付&lt;/li&gt;
&lt;li&gt;部分训练任务相当于资深工程师连续数天的工作量&lt;/li&gt;
&lt;li&gt;使用真实计算集群、存储系统、内部文档与代码库&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;类比&lt;/strong&gt;：以前是让模型做练习题，现在是让它直接去公司实习。&lt;/p&gt;
&lt;h2 id="四个方向的核心提升"&gt;四个方向的核心提升
&lt;/h2&gt;&lt;h3 id="1-编程与agent能力重点"&gt;1. 编程与Agent能力（重点）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;评测&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.3&lt;/th&gt;
					&lt;th&gt;提升幅度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 3.0&lt;/td&gt;
					&lt;td&gt;4.6&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;28.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+515%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSWE v1.1&lt;/td&gt;
					&lt;td&gt;46.2&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;66.9&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+45%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Agents&amp;rsquo; Last Exam&lt;/td&gt;
					&lt;td&gt;23.8&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;28.5&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+20%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GDPval-AA v2&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1769分&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;覆盖44种职业&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Terminal-Bench 28.3 分，开源模型排名第一。DeepSWE 66.9，比肩 Claude Fable 5。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;编程体感较 GLM-5.2 提升 50%&lt;/strong&gt;——这是智谱自己的原话，不是我编的。&lt;/p&gt;
&lt;h3 id="2-复杂项目交付"&gt;2. 复杂项目交付
&lt;/h3&gt;&lt;p&gt;以前的模型写单个函数还行，面对完整项目就崩。&lt;/p&gt;
&lt;p&gt;GLM-5.3 能处理：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;数万行代码、上百个文件、多个依赖系统&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;极少人工干预下自主开发、反复验证、推进至可交付状态&lt;/li&gt;
&lt;li&gt;覆盖前端开发、Bug 修复、代码重构等真实任务&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-网络安全能力涌现"&gt;3. 网络安全能力（涌现）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;评测&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.3&lt;/th&gt;
					&lt;th&gt;对标&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;CyberGym&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;83.5%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;Mythos 5: 83.8%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;ExploitBench&lt;/td&gt;
					&lt;td&gt;24.4%&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;54.4%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+123%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;白盒代码审查、漏洞发现与验证能力接近 Mythos 5。&lt;/p&gt;
&lt;p&gt;优势集中在漏洞利用链前端。更深入的攻防仍有提升空间。&lt;/p&gt;
&lt;h3 id="4-通用能力"&gt;4. 通用能力
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;上下文窗口：&lt;strong&gt;1M tokens&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;最大输出：&lt;strong&gt;128K tokens&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;支持：思考模式、流式输出、Function Calling、上下文缓存、结构化输出、MCP&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="竞品对比"&gt;竞品对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;Artificial Analysis评分&lt;/th&gt;
					&lt;th&gt;编程能力&lt;/th&gt;
					&lt;th&gt;开源&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;待测&lt;/td&gt;
					&lt;td&gt;Terminal-Bench 28.3&lt;/td&gt;
					&lt;td&gt;✅ 宽松许可证&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;53分&lt;/td&gt;
					&lt;td&gt;Terminal-Bench 4.6&lt;/td&gt;
					&lt;td&gt;✅&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek 顶级模型&lt;/td&gt;
					&lt;td&gt;53分&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;✅&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Fable 5&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;DeepSWE ~67&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPT 5.6&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;GLM-5.2 和 DeepSeek 顶级模型在 Artificial Analysis 上同为 53 分。&lt;/p&gt;
&lt;p&gt;GLM-5.3 的目标是通过后训练 Scaling 缩小与 Kimi K3、Claude Fable 5、GPT 5.6 的差距。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键点：以上闭源模型全部不开放权重。GLM-5.3 将以宽松许可证开放。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="对开发者意味着什么"&gt;对开发者意味着什么
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;如果你用 AI 写代码：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;GLM-5.3 是目前开源阵营里编程能力最强的模型。等 API 上线后可以第一时间试用。&lt;/p&gt;
&lt;p&gt;GLM Coding Plan 已经全量上线 GLM-5.3。订阅用户现在就能用。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果你做 AI Agent 开发：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;1M 上下文 + 128K 输出 + Function Calling + MCP，这组合在开源模型里几乎没有对手。&lt;/p&gt;
&lt;p&gt;Agent 场景最吃上下文长度和工具调用能力，GLM-5.3 两个都是顶配。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果你关注开源生态：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;智谱延续宽松许可证策略。GLM-5.2 发布后智谱市值一度冲到 1370 亿美元。&lt;/p&gt;
&lt;p&gt;开源 + 强编程能力 = 开发者生态飞轮转起来了。&lt;/p&gt;
&lt;h2 id="我的看法"&gt;我的看法
&lt;/h2&gt;&lt;p&gt;后训练 Scaling 这条路，之前大家都知道重要，但没人做到这个程度。&lt;/p&gt;
&lt;p&gt;GLM-5.3 证明了一件事：&lt;strong&gt;底座模型的能力上限，远比我们以为的要高。&lt;/strong&gt; 关键在于你怎么训练。&lt;/p&gt;
&lt;p&gt;不换底座，纯靠训练策略优化就能实现 50% 的编程能力提升。&lt;/p&gt;
&lt;p&gt;这对整个行业都是好消息——意味着未来模型能力的提升不完全依赖天价算力。&lt;/p&gt;
&lt;h2 id="三个备选标题"&gt;三个备选标题
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;GLM-5.3 今天发布：编程能力暴涨50%，开源模型第一次站上巅峰&lt;/strong&gt;（数字+悬念）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;智谱 GLM-5.3 来了：Terminal-Bench 从 4.6 到 28.3，开源编程模型变天了&lt;/strong&gt;（数字+威胁）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;不换底座，编程能力涨50%：GLM-5.3 的后训练 Scaling 有多猛&lt;/strong&gt;（反常识）&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;p&gt;关注 varkm，一起学习，一起成长&lt;/p&gt;</description></item></channel></rss>