<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Benchmark on Kalend's Blog</title><link>https://blog.kalend.top/tags/benchmark/</link><description>Recent content in Benchmark on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Tue, 18 Aug 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/benchmark/index.xml" rel="self" type="application/rss+xml"/><item><title>GPT-5.6 发布一个月，最大的变化不是性能，是它吞掉了Codex</title><link>https://blog.kalend.top/2026/08/18/2026-08-18-gpt56-sol-luna-review.html/</link><pubDate>Tue, 18 Aug 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/18/2026-08-18-gpt56-sol-luna-review.html/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;7月9日发布的 GPT-5.6，性能提升是意料之中的事。真正让行业震动的，是 OpenAI 把 Codex Agent 直接塞进了主模型——你不再需要单独的编程 Agent 产品了。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;GPT-5.6 最大的变化不是跑分，而是&lt;strong&gt;产品形态的合并&lt;/strong&gt;。Codex 从独立产品变成模型内置能力，三档定价让开发者按场景选模型而不是选产品。Sol 在编程和推理上全面领先，Luna 降价 80% 后成本低到可以不计，Terra 成了 GPT-5.5 的直接平替。&lt;/p&gt;
&lt;h2 id="三档定价不是高低配是三个物种"&gt;三档定价：不是高低配，是三个物种
&lt;/h2&gt;&lt;p&gt;GPT-5.6 不再是一个模型，而是一个家族。代号 5.6 标记的是代际，Sol/Terra/Luna 标记的是&lt;strong&gt;持久的能力层级&lt;/strong&gt;——它们各自有独立的迭代节奏，OpenAI 可以单独更新某一个而不影响其他两个。&lt;/p&gt;
&lt;p&gt;当前定价（标准模式，短上下文）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;型号&lt;/th&gt;
					&lt;th&gt;定位&lt;/th&gt;
					&lt;th&gt;输入价（/MTok）&lt;/th&gt;
					&lt;th&gt;输出价（/MTok）&lt;/th&gt;
					&lt;th&gt;缓存读取&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Sol&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;旗舰推理&lt;/td&gt;
					&lt;td&gt;$5.00&lt;/td&gt;
					&lt;td&gt;$30.00&lt;/td&gt;
					&lt;td&gt;$0.50&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Terra&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;均衡之选&lt;/td&gt;
					&lt;td&gt;$2.00&lt;/td&gt;
					&lt;td&gt;$12.00&lt;/td&gt;
					&lt;td&gt;$0.20&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Luna&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;极速廉价&lt;/td&gt;
					&lt;td&gt;$0.20&lt;/td&gt;
					&lt;td&gt;$1.20&lt;/td&gt;
					&lt;td&gt;$0.02&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注意看最后一列——缓存读取只要原价的 10%。这意味着如果你的应用有大量重复上下文（比如系统提示词），实际成本会大幅低于标价。&lt;/p&gt;
&lt;p&gt;7月30日的调价幅度很大：&lt;strong&gt;Luna 直接砍了 80%&lt;/strong&gt;（从 $1/$6 降到 $0.20/$1.20），Terra 降了 20%（从 $2.5/$15 到 $2/$12）。Sol 没动。&lt;/p&gt;
&lt;p&gt;这个信号很清楚：OpenAI 要让 Luna 成为&lt;strong&gt;高吞吐场景的默认选择&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;三个型号都支持六个推理档位：none、low、medium、high、xhigh、max。上下文窗口 1.05M tokens，最大输出 128K tokens。知识截止日期 2026年2月16日。&lt;/p&gt;
&lt;h2 id="codex-融入主模型这才是真正的大新闻"&gt;Codex 融入主模型：这才是真正的大新闻
&lt;/h2&gt;&lt;p&gt;GPT-5.6 同时在 ChatGPT、Codex 和 API 三个入口可用。&lt;strong&gt;同一个模型，三个入口，共享能力&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;以前的 OpenAI 产品线是分裂的：ChatGPT 管对话，Codex 管编程，API 管调用。开发者要同时订阅多个产品。现在，GPT-5.6 把这些能力全部内置到模型本身。&lt;/p&gt;
&lt;p&gt;具体来说，GPT-5.6 内置了两个关键新能力：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Programmatic Tool Calling&lt;/strong&gt;——模型可以自己写程序来协调工具调用，处理中间结果，过滤大量数据，而不是每个工具响应都走一遍模型。在 Unity 场景构建工作流中，总 token 消耗减少 63.5%，模型调用轮次减少 50.1%。在金融研报场景中，prompt token 减少 38%，质量不变。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Multi-agent（Beta）&lt;/strong&gt;——Sol 的 Ultra 模式默认协调 4 个并行 Agent。OpenAI 的数据显示，在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 三个评测上，4-Agent 配置的得分-延迟曲线全面优于单 Agent。在 API 中，开发者可以通过 Responses API 的 multi-agent beta 构建类似的并行工作流。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;这意味着什么？&lt;/strong&gt; 以前你需要 CrewAI、LangGraph 来编排多 Agent，现在模型自己就能做。Agent 框架的价值不是消失了，而是&lt;strong&gt;被迫往更上层走&lt;/strong&gt;——从&amp;quot;编排工具调用&amp;quot;升级到&amp;quot;编排业务逻辑&amp;quot;。&lt;/p&gt;
&lt;h2 id="跑分拆解sol-到底强在哪"&gt;跑分拆解：Sol 到底强在哪
&lt;/h2&gt;&lt;p&gt;以下数据全部来自 OpenAI 官方博客和第三方独立评测（Artificial Analysis、DeepSWE），我逐一验证过：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;评测&lt;/th&gt;
					&lt;th&gt;GPT-5.6 Sol&lt;/th&gt;
					&lt;th&gt;对比对象&lt;/th&gt;
					&lt;th&gt;差距&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;Agents&amp;rsquo; Last Exam&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;53.6&lt;/td&gt;
					&lt;td&gt;Claude Fable 5: 40.5&lt;/td&gt;
					&lt;td&gt;+13.1 分&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;AA Coding Agent Index&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;80.0&lt;/td&gt;
					&lt;td&gt;Claude Fable 5: 77.2&lt;/td&gt;
					&lt;td&gt;+2.8 分&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;（pass@1）&lt;/td&gt;
					&lt;td&gt;73%&lt;/td&gt;
					&lt;td&gt;Claude Opus 5: 74%&lt;/td&gt;
					&lt;td&gt;基本持平&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;CTF 网络安全&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;73.5%&lt;/td&gt;
					&lt;td&gt;GPT-5.5: 47.9%&lt;/td&gt;
					&lt;td&gt;+25.6 个百分点&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;内部 RSI 评测&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;比 GPT-5.5 高 16.2 分&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;但跑分只是故事的一半。&lt;strong&gt;效率才是真正的杀手锏&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;在 Agents&amp;rsquo; Last Exam 上，Sol 完成任务的时间比 Fable 5 少 61%，成本大约一半。Terra 和 Luna 的表现更让人意外——它们在大约 Fable 5 十六分之一的成本下，达到了接近的性能。&lt;/p&gt;
&lt;p&gt;Luna 的 DeepSWE 得分 67%（和 GPT-5.5 持平），但平均成本只有 $0.61——GPT-5.5 是 $7.23。&lt;strong&gt;同样的性能，成本降了 90%&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;在 QAInsights 的实测中，同样一个客服分类任务：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Luna：155.6 tok/s，总耗时 4.4 秒，成本 $0.00172&lt;/li&gt;
&lt;li&gt;Terra：79.2 tok/s，总耗时 6.8 秒&lt;/li&gt;
&lt;li&gt;Sol：42.1 tok/s，总耗时 9.4 秒&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;有意思的是，&lt;strong&gt;Terra 的首 token 延迟最低&lt;/strong&gt;（1931ms），比 Luna 还快 25%。但 Luna 的吞吐量是 Terra 的两倍，所以最终还是 Luna 先完成。&lt;strong&gt;最快启动和最快完成，是两个不同的模型&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="开发者该怎么选"&gt;开发者该怎么选
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;推荐型号&lt;/th&gt;
					&lt;th&gt;理由&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;复杂编程、长链推理、研究&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;Sol&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;推理最强，Agent 表现最好&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;日常开发、代码审查、知识工作&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;Terra&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;性能接近 GPT-5.5，成本减半&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;批量分类、数据清洗、简单问答&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;Luna&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;速度最快，成本低到可以不计&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;不确定用哪个&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;Terra 先上&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;最安全的默认选择&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一个实用策略：&lt;strong&gt;用 Luna 做筛选，用 Sol 做精加工&lt;/strong&gt;。先让 Luna 批量处理一遍，把需要深度推理的挑出来交给 Sol。两步下来总成本可能比全程用 Terra 还低。&lt;/p&gt;
&lt;p&gt;另一个细节：所有三个型号都支持 Functions、Web search、File search 和 Computer use。&lt;strong&gt;工具能力不按定价分级&lt;/strong&gt;，这意味着 Luna 也能用工具，只是推理深度不如 Sol。&lt;/p&gt;
&lt;h2 id="不只是编程设计和安全也是亮点"&gt;不只是编程：设计和安全也是亮点
&lt;/h2&gt;&lt;p&gt;GPT-5.6 的提升不只是编程。OpenAI 在设计能力上下了狠功夫。&lt;/p&gt;
&lt;p&gt;官方演示中，GPT-5.6 可以从高层级描述直接生成可交互的前端界面，而且能通过 Computer Use 检查渲染结果、发现视觉问题、自动修正。Cursor 的联合创始人说它是&amp;quot;CursorBench 上表现最好的模型之一&amp;quot;。Canva 的 AI 产品负责人说它的演示文稿生成能力比竞品强 1.6 倍，而且 token 效率更高。&lt;/p&gt;
&lt;p&gt;在网络安全领域，提升更夸张。CTF 挑战赛得分从 GPT-5.5 的 47.9% 跳到 73.5%。ExploitGym 的漏洞利用测试，两小时窗口内 pass rate 从 15.1% 翻到 24.9%，六小时窗口达到 33.7%。&lt;/p&gt;
&lt;p&gt;不过 OpenAI 也承认，GPT-5.6 在&amp;quot;找到漏洞&amp;quot;上比&amp;quot;自主发动端到端攻击&amp;quot;强得多——这对防御者来说是好消息。Daybreak 项目提供了受信任访问通道，让安全研究人员可以在授权环境中使用更强的网络安全能力。&lt;/p&gt;
&lt;h2 id="成本对比一张表算清楚"&gt;成本对比：一张表算清楚
&lt;/h2&gt;&lt;p&gt;很多人只看单价，不看总成本。这里用 DeepSWE 的实际数据算一笔账：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;DeepSWE 得分&lt;/th&gt;
					&lt;th&gt;平均成本/task&lt;/th&gt;
					&lt;th&gt;平均输出 tokens&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Opus 5&lt;/td&gt;
					&lt;td&gt;74%&lt;/td&gt;
					&lt;td&gt;$11.84&lt;/td&gt;
					&lt;td&gt;118K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;73%&lt;/td&gt;
					&lt;td&gt;$8.39&lt;/td&gt;
					&lt;td&gt;60K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Fable 5&lt;/td&gt;
					&lt;td&gt;70%&lt;/td&gt;
					&lt;td&gt;$21.63&lt;/td&gt;
					&lt;td&gt;119K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;69%&lt;/td&gt;
					&lt;td&gt;$4.65&lt;/td&gt;
					&lt;td&gt;81K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;67%&lt;/td&gt;
					&lt;td&gt;$0.61&lt;/td&gt;
					&lt;td&gt;73K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPT-5.5&lt;/td&gt;
					&lt;td&gt;67%&lt;/td&gt;
					&lt;td&gt;$7.23&lt;/td&gt;
					&lt;td&gt;46K&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Sol 比 Opus 5 便宜 29%，输出 tokens 只有一半。Luna 和 GPT-5.5 得分相同，但成本只有 8.4%。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果按月跑 1000 个任务估算：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;全程用 Sol：$8,390&lt;/li&gt;
&lt;li&gt;全程用 Luna：$610&lt;/li&gt;
&lt;li&gt;Luna 筛选 + Sol 精加工（假设 20% 需要 Sol）：$610 + $1,678 = $2,288&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;混合策略比全程 Sol 省 73%，比全程 Luna 只贵 3.7 倍但质量大幅提升。&lt;/p&gt;
&lt;h2 id="对国内开发者的影响"&gt;对国内开发者的影响
&lt;/h2&gt;&lt;p&gt;老问题不变：OpenAI API 在国内的可用性没有根本变化。但有几个值得认真算的账：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;1. Luna 的成本已经低到中转商也能承受。&lt;/strong&gt; $0.20/MTok 的输入价，缓存命中后 $0.02，一个 1000 字的请求不到一分钱。批量处理 10 万条数据，总成本可能就几美元。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. Terra 是 GPT-5.5 的直接替代品。&lt;/strong&gt; 如果你在用 GPT-5.5 的 API，切到 Terra 能省一半钱，性能基本不变。OpenAI 自己就是这么说的——Terra 的定位就是 GPT-5.5 的迁移目标。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. Codex Agent 内置对 Agent 框架的冲击是真实的。&lt;/strong&gt; 当模型自己就能编排工具、分配资源、并行处理，外面那层框架的必要性就在下降。框架要活下来，得往模型做不了的方向走——业务抽象、领域知识、可视化编排。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;4. 缓存机制值得关注。&lt;/strong&gt; GPT-5.6 引入了显式缓存断点和 30 分钟最低缓存生命周期。对有大量重复上下文的应用来说，这能省很多钱。&lt;/p&gt;
&lt;h2 id="最后说一句"&gt;最后说一句
&lt;/h2&gt;&lt;p&gt;GPT-5.6 发布一个月了。跑分会被追平，价格会被卷下来，这些都不是新闻。&lt;/p&gt;
&lt;p&gt;真正的新闻是 OpenAI 用&amp;quot;三档定价 + Codex 内置&amp;quot;重新定义了什么叫&amp;quot;一个模型&amp;quot;。以前你买的是一个 API endpoint，现在你买的是一个可以自己编排工具、自己分配资源的 Agent 平台。&lt;/p&gt;
&lt;p&gt;这个趋势不会停下来。下一个问题不是&amp;quot;GPT-5.6 能不能做这个&amp;quot;，而是**&amp;ldquo;我还需要在外面包一层 Agent 框架吗&amp;rdquo;**。&lt;/p&gt;</description></item></channel></rss>