<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>国产模型 on Kalend's Blog</title><link>https://blog.kalend.top/categories/%E5%9B%BD%E4%BA%A7%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 国产模型 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Fri, 14 Aug 2026 14:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/categories/%E5%9B%BD%E4%BA%A7%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>GLM-5.3 今天发布：编程能力暴涨50%，开源模型第一次站上巅峰</title><link>https://blog.kalend.top/2026/08/14/2026-08-14-glm-53-release.html/</link><pubDate>Fri, 14 Aug 2026 14:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/14/2026-08-14-glm-53-release.html/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;今天智谱发布了 GLM-5.3，同一天财联社、每经、IT之家都在报。我第一时间看完技术报告，说一句：&lt;strong&gt;这次不是堆参数，是训练方法论变了。&lt;/strong&gt;&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;GLM-5.3 和 GLM-5.2 &lt;strong&gt;同一个底座&lt;/strong&gt;，没换架构、没加参数。纯靠后训练 Scaling，编程能力提升 50%。&lt;/p&gt;
&lt;p&gt;Terminal-Bench 3.0 从 4.6 干到 28.3，&lt;strong&gt;开源模型第一&lt;/strong&gt;。CyberGym 安全评测 83.5%，逼近闭源天花板 Mythos 5 的 83.8%。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;一句话：开源模型在编程赛道，第一次有资格和闭源顶级模型坐在同一张桌子上。&lt;/strong&gt;&lt;/p&gt;
&lt;!-- more --&gt;
&lt;h2 id="什么是后训练-scaling"&gt;什么是&amp;quot;后训练 Scaling&amp;quot;
&lt;/h2&gt;&lt;p&gt;这个词很重要，必须解释清楚。&lt;/p&gt;
&lt;p&gt;传统 Scaling Law 是&lt;strong&gt;堆参数、堆数据、堆算力&lt;/strong&gt;——模型越大越聪明。&lt;/p&gt;
&lt;p&gt;后训练 Scaling 换了个思路：&lt;strong&gt;底座不动，靠更精细的训练策略榨出更多能力。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;GLM-5.3 的做法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练不再局限于孤立编程题&lt;/li&gt;
&lt;li&gt;扩展到&lt;strong&gt;完整工程流程&lt;/strong&gt;：发现问题→分析方案→实施→验证→交付&lt;/li&gt;
&lt;li&gt;部分训练任务相当于资深工程师连续数天的工作量&lt;/li&gt;
&lt;li&gt;使用真实计算集群、存储系统、内部文档与代码库&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;类比&lt;/strong&gt;：以前是让模型做练习题，现在是让它直接去公司实习。&lt;/p&gt;
&lt;h2 id="四个方向的核心提升"&gt;四个方向的核心提升
&lt;/h2&gt;&lt;h3 id="1-编程与agent能力重点"&gt;1. 编程与Agent能力（重点）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;评测&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.3&lt;/th&gt;
					&lt;th&gt;提升幅度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 3.0&lt;/td&gt;
					&lt;td&gt;4.6&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;28.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+515%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSWE v1.1&lt;/td&gt;
					&lt;td&gt;46.2&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;66.9&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+45%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Agents&amp;rsquo; Last Exam&lt;/td&gt;
					&lt;td&gt;23.8&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;28.5&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+20%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GDPval-AA v2&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1769分&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;覆盖44种职业&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Terminal-Bench 28.3 分，开源模型排名第一。DeepSWE 66.9，比肩 Claude Fable 5。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;编程体感较 GLM-5.2 提升 50%&lt;/strong&gt;——这是智谱自己的原话，不是我编的。&lt;/p&gt;
&lt;h3 id="2-复杂项目交付"&gt;2. 复杂项目交付
&lt;/h3&gt;&lt;p&gt;以前的模型写单个函数还行，面对完整项目就崩。&lt;/p&gt;
&lt;p&gt;GLM-5.3 能处理：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;数万行代码、上百个文件、多个依赖系统&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;极少人工干预下自主开发、反复验证、推进至可交付状态&lt;/li&gt;
&lt;li&gt;覆盖前端开发、Bug 修复、代码重构等真实任务&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-网络安全能力涌现"&gt;3. 网络安全能力（涌现）
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;评测&lt;/th&gt;
					&lt;th&gt;GLM-5.2&lt;/th&gt;
					&lt;th&gt;GLM-5.3&lt;/th&gt;
					&lt;th&gt;对标&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;CyberGym&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;83.5%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;Mythos 5: 83.8%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;ExploitBench&lt;/td&gt;
					&lt;td&gt;24.4%&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;54.4%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;+123%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;白盒代码审查、漏洞发现与验证能力接近 Mythos 5。&lt;/p&gt;
&lt;p&gt;优势集中在漏洞利用链前端。更深入的攻防仍有提升空间。&lt;/p&gt;
&lt;h3 id="4-通用能力"&gt;4. 通用能力
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;上下文窗口：&lt;strong&gt;1M tokens&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;最大输出：&lt;strong&gt;128K tokens&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;支持：思考模式、流式输出、Function Calling、上下文缓存、结构化输出、MCP&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="竞品对比"&gt;竞品对比
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;Artificial Analysis评分&lt;/th&gt;
					&lt;th&gt;编程能力&lt;/th&gt;
					&lt;th&gt;开源&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;待测&lt;/td&gt;
					&lt;td&gt;Terminal-Bench 28.3&lt;/td&gt;
					&lt;td&gt;✅ 宽松许可证&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;53分&lt;/td&gt;
					&lt;td&gt;Terminal-Bench 4.6&lt;/td&gt;
					&lt;td&gt;✅&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek 顶级模型&lt;/td&gt;
					&lt;td&gt;53分&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;✅&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Fable 5&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;DeepSWE ~67&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPT 5.6&lt;/td&gt;
					&lt;td&gt;高于53&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;❌&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;GLM-5.2 和 DeepSeek 顶级模型在 Artificial Analysis 上同为 53 分。&lt;/p&gt;
&lt;p&gt;GLM-5.3 的目标是通过后训练 Scaling 缩小与 Kimi K3、Claude Fable 5、GPT 5.6 的差距。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;关键点：以上闭源模型全部不开放权重。GLM-5.3 将以宽松许可证开放。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="对开发者意味着什么"&gt;对开发者意味着什么
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;如果你用 AI 写代码：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;GLM-5.3 是目前开源阵营里编程能力最强的模型。等 API 上线后可以第一时间试用。&lt;/p&gt;
&lt;p&gt;GLM Coding Plan 已经全量上线 GLM-5.3。订阅用户现在就能用。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果你做 AI Agent 开发：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;1M 上下文 + 128K 输出 + Function Calling + MCP，这组合在开源模型里几乎没有对手。&lt;/p&gt;
&lt;p&gt;Agent 场景最吃上下文长度和工具调用能力，GLM-5.3 两个都是顶配。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;如果你关注开源生态：&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;智谱延续宽松许可证策略。GLM-5.2 发布后智谱市值一度冲到 1370 亿美元。&lt;/p&gt;
&lt;p&gt;开源 + 强编程能力 = 开发者生态飞轮转起来了。&lt;/p&gt;
&lt;h2 id="我的看法"&gt;我的看法
&lt;/h2&gt;&lt;p&gt;后训练 Scaling 这条路，之前大家都知道重要，但没人做到这个程度。&lt;/p&gt;
&lt;p&gt;GLM-5.3 证明了一件事：&lt;strong&gt;底座模型的能力上限，远比我们以为的要高。&lt;/strong&gt; 关键在于你怎么训练。&lt;/p&gt;
&lt;p&gt;不换底座，纯靠训练策略优化就能实现 50% 的编程能力提升。&lt;/p&gt;
&lt;p&gt;这对整个行业都是好消息——意味着未来模型能力的提升不完全依赖天价算力。&lt;/p&gt;
&lt;h2 id="三个备选标题"&gt;三个备选标题
&lt;/h2&gt;&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;GLM-5.3 今天发布：编程能力暴涨50%，开源模型第一次站上巅峰&lt;/strong&gt;（数字+悬念）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;智谱 GLM-5.3 来了：Terminal-Bench 从 4.6 到 28.3，开源编程模型变天了&lt;/strong&gt;（数字+威胁）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;不换底座，编程能力涨50%：GLM-5.3 的后训练 Scaling 有多猛&lt;/strong&gt;（反常识）&lt;/li&gt;
&lt;/ol&gt;
&lt;hr&gt;
&lt;p&gt;关注 varkm，一起学习，一起成长&lt;/p&gt;</description></item><item><title>MiMo v2.5-Pro长测30天：小米推理模型的真实能力边界</title><link>https://blog.kalend.top/2026/08/11/2026-08-11-mimo-v25-pro-30day-review.html/</link><pubDate>Tue, 11 Aug 2026 09:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/11/2026-08-11-mimo-v25-pro-30day-review.html/</guid><description>&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;用了30天，我的判断是：&lt;strong&gt;MiMo v2.5-Pro 是目前性价比最高的 Agent 模型，但不是万能模型。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Agent 能力全球开源第一、Token 效率比竞品省 40-60%、缓存命中价低到 ¥0.025/百万 token——这些数据都是真的。但通识推理比 DeepSeek 差 20 分、多源信息合成时会编造不存在的产品、缓存命中率远达不到官方声称的 89%——这些坑也是真的。&lt;/p&gt;
&lt;p&gt;30天下来，我总结出一个选型原则：&lt;strong&gt;Agent/自动化场景优先考虑 MiMo，知识密集型任务换别的模型。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="我的使用场景"&gt;我的使用场景
&lt;/h2&gt;&lt;p&gt;过去30天，我把 MiMo v2.5-Pro 接入了日常工作流的全部环节：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每日内容选题、写稿、审校&lt;/li&gt;
&lt;li&gt;技术调研和竞品分析&lt;/li&gt;
&lt;li&gt;Python/Shell/JavaScript 代码生成与调试&lt;/li&gt;
&lt;li&gt;运维自动化（定时任务编排、部署流水线）&lt;/li&gt;
&lt;li&gt;知识库管理和记忆检索&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;日均消耗约 50-80 万 token，30天累计超过 1500 万 token。不是跑 benchmark，是真刀真枪干活。&lt;/p&gt;
&lt;h2 id="模型基本面"&gt;模型基本面
&lt;/h2&gt;&lt;p&gt;先摆参数，后面所有结论都基于这个基础：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;MiMo-V2.5-Pro&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;厂商&lt;/td&gt;
					&lt;td&gt;小米 Core AI 团队&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布&lt;/td&gt;
					&lt;td&gt;2026年4月27日&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，1.02T 总参 / 42B 激活&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文&lt;/td&gt;
					&lt;td&gt;1M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;最大输出&lt;/td&gt;
					&lt;td&gt;128K tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源&lt;/td&gt;
					&lt;td&gt;MIT&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;架构上是典型的 MoE（混合专家），总参数万亿级但每次推理只激活 42B，这就是它便宜的原因之一。&lt;/p&gt;
&lt;h2 id="四款国产模型横评"&gt;四款国产模型横评
&lt;/h2&gt;&lt;p&gt;30天里我同时用过 DeepSeek V4-Pro、Kimi K2.6 和 GLM-5.1，直接上对比表：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;MiMo V2.5-Pro&lt;/th&gt;
					&lt;th&gt;DeepSeek V4-Pro&lt;/th&gt;
					&lt;th&gt;Kimi K2.6&lt;/th&gt;
					&lt;th&gt;GLM-5.1&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Agent 能力&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1581&lt;/strong&gt; (GDPVal-AA)&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td&gt;57.2%&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;58.6%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;58.4%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;MMLU-Pro&lt;/td&gt;
					&lt;td&gt;68.5%&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;87.5%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入价/百万token&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥12（限时¥3）&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中价&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥0.025&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥1.2&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1M&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
					&lt;td&gt;202K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Token 效率&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;最优&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;次优&lt;/td&gt;
					&lt;td&gt;比 MiMo 多 85%&lt;/td&gt;
					&lt;td&gt;比 MiMo 多 20%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一句话总结：&lt;strong&gt;MiMo 在 Agent 场景碾压，但在 MMLU-Pro 这类通识考试上被 DeepSeek 和 Qwen 拉开 20 分差距。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="30天验证的6个真实优势"&gt;30天验证的6个真实优势
&lt;/h2&gt;&lt;h3 id="1-token-效率是真的省"&gt;1. Token 效率是真的省
&lt;/h3&gt;&lt;p&gt;这是最直观的感受。做同样的任务，MiMo 的 Token 消耗比 Claude Sonnet 少 40-60%。VentureBeat、dayahimour.org、Superculture 三个独立来源都确认了这个数字。&lt;/p&gt;
&lt;p&gt;体现在账单上更明显——缓存命中价 ¥0.025/百万 token，比 DeepSeek 的 ¥1.2 便宜 48 倍。一个月下来，我的 API 账单大概只有之前用 DeepSeek 的 1/3。&lt;/p&gt;
&lt;h3 id="2-代码能力扎实"&gt;2. 代码能力扎实
&lt;/h3&gt;&lt;p&gt;Python、Shell、JavaScript 的代码生成都很可靠。工具调用错误率低（平均 2.82%），结构化输出基本能用。&lt;/p&gt;
&lt;p&gt;日常的运维脚本、数据处理脚本、API 对接代码，MiMo 生成的质量和 DeepSeek 差不多，但 Token 消耗少很多。这是它性价比高的核心原因。&lt;/p&gt;
&lt;h3 id="3-中文表达自然"&gt;3. 中文表达自然
&lt;/h3&gt;&lt;p&gt;这一点比 Claude 和 GPT 都好。MiMo 生成的中文没有那种翻译腔，用词和句式都比较地道。写公众号文章时 AI 味明显更低，审校时需要改的地方更少。&lt;/p&gt;
&lt;h3 id="4-1m-上下文是真能用"&gt;4. 1M 上下文是真能用
&lt;/h3&gt;&lt;p&gt;不是所有标 1M 的模型都能真的处理 100 万 token。MiMo 的长上下文在实际使用中表现稳定，我在处理长文档和多轮对话时没有遇到上下文丢失的问题。&lt;/p&gt;
&lt;h3 id="5-推理稳定"&gt;5. 推理稳定
&lt;/h3&gt;&lt;p&gt;复杂任务规划、多步骤决策、条件分支判断——这些场景下 MiMo 的表现很一致，不会出现&amp;quot;上一步还行下一步就飞了&amp;quot;的情况。&lt;/p&gt;
&lt;h3 id="6-生态适配广"&gt;6. 生态适配广
&lt;/h3&gt;&lt;p&gt;OpenRouter 上 MiMo 的流量排名靠前，DeepInfra、Xiaomi 直连、AtlasCloud 等多个提供商都有部署。选提供商时有冗余，不会被单一节点卡死。&lt;/p&gt;
&lt;h2 id="30天踩过的5个坑必须诚实说"&gt;30天踩过的5个坑（必须诚实说）
&lt;/h2&gt;&lt;h3 id="坑1多源信息合成会幻觉最严重"&gt;坑1：多源信息合成会幻觉（最严重）
&lt;/h3&gt;&lt;p&gt;这是 30 天里最惊悚的一次。我在做选题推荐时，让模型同时处理 HN、V2EX、Product Hunt、HuggingFace、arXiv、Dev.to 六个平台的热门数据。&lt;/p&gt;
&lt;p&gt;输出 5 个推荐选题，其中 4 个存在幻觉：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;编造了一个不存在的模型&amp;quot;Meta Muse Glimmer 30B&amp;quot;&lt;/li&gt;
&lt;li&gt;编造了具体的数字&amp;quot;HN score 1023&amp;quot;&lt;/li&gt;
&lt;li&gt;编造了根本不存在的产品名称&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;根因&lt;/strong&gt;：大量异构数据同时输入时，模型容易把不同来源的信息混搭，生成看似合理但完全虚构的内容。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;教训&lt;/strong&gt;：凡是涉及&amp;quot;从多个来源汇总信息&amp;quot;的任务，必须逐条验证。不能信任模型给出的具体数字和产品名。&lt;/p&gt;
&lt;h3 id="坑2通识推理是明显短板"&gt;坑2：通识推理是明显短板
&lt;/h3&gt;&lt;p&gt;MMLU-Pro 只有 68.5%，DeepSeek V4-Pro 是 87.5%，差了将近 20 分。GPQA-Diamond 也类似，MiMo 66.7% vs Qwen3.5-Plus 88.4%。&lt;/p&gt;
&lt;p&gt;实际体感：问一些需要广泛知识储备的问题（比如解释某个物理概念、分析某个历史事件），MiMo 的回答深度明显不如 DeepSeek。它更像一个&amp;quot;做事的模型&amp;quot;而不是&amp;quot;博学的模型&amp;quot;。&lt;/p&gt;
&lt;h3 id="坑3长任务偶尔中断"&gt;坑3：长任务偶尔中断
&lt;/h3&gt;&lt;p&gt;社区评测里提到的&amp;quot;长时间任务生成中断&amp;quot;，我自己也遇到过。特别是在处理大量文件或复杂编排任务时，偶尔会突然中断输出。&lt;/p&gt;
&lt;p&gt;不是每次都发生，但概率不低。对于需要持续运行的自动化任务，这是个风险点，需要做好重试和断点续传的逻辑。&lt;/p&gt;
&lt;h3 id="坑4缓存命中率名不副实"&gt;坑4：缓存命中率名不副实
&lt;/h3&gt;&lt;p&gt;官方声称缓存命中率约 89%，TRAE 社区实测约 40%，我的使用体验也差不多。&lt;/p&gt;
&lt;p&gt;这意味着实际账单会比理论计算高不少。如果按 89% 命中率算成本，实际可能只有一半多的请求命中缓存，成本直接翻倍。定价虽然便宜，但不要按最理想情况做预算。&lt;/p&gt;
&lt;h3 id="坑5pro-版不支持多模态"&gt;坑5：Pro 版不支持多模态
&lt;/h3&gt;&lt;p&gt;MiMo-V2.5-Pro 是纯文本模型。需要理解图片、音频、视频时，必须切换到 V2.5 基础版。&lt;/p&gt;
&lt;p&gt;这在实际使用中是个麻烦。比如让我分析一张截图里的数据，Pro 版直接报错，得手动切模型。如果你的工作流涉及多模态输入，要提前规划好模型切换策略。&lt;/p&gt;
&lt;h2 id="定价真正的价格屠夫"&gt;定价：真正的价格屠夫
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输入/百万token&lt;/th&gt;
					&lt;th&gt;输出/百万token&lt;/th&gt;
					&lt;th&gt;缓存命中&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥3&lt;/td&gt;
					&lt;td&gt;¥6&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥0.025&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V4-Pro&lt;/td&gt;
					&lt;td&gt;¥12（限时¥3）&lt;/td&gt;
					&lt;td&gt;¥24（限时¥6）&lt;/td&gt;
					&lt;td&gt;¥1.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.1&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
					&lt;td&gt;~¥32&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;缓存命中价 ¥0.025/百万 token，降幅 99%。&lt;/p&gt;
&lt;p&gt;小米的降价逻辑来自推理系统优化：基于 SGLang HiCache，KV Cache 在 GPU/CPU/SSD 多级存储间的传输量降到优化前的 1/7，可缓存 Token 数提高到 5 倍。&lt;/p&gt;
&lt;h2 id="到底该不该用"&gt;到底该不该用？
&lt;/h2&gt;&lt;p&gt;30天下来，我的选型逻辑变成了这样：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;理由&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Agent / 自动化任务&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;Agent 能力开源第一，Token 效率最优&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代码生成 / 脚本&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;可靠且便宜&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;通识推理 / 科学问答&lt;/td&gt;
					&lt;td&gt;DeepSeek V4-Pro 或 Qwen3.5&lt;/td&gt;
					&lt;td&gt;MMLU-Pro 差距 20+ 分&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;中文内容创作&lt;/td&gt;
					&lt;td&gt;MiMo V2.5-Pro&lt;/td&gt;
					&lt;td&gt;中文表达自然，AI 味低&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多模态理解&lt;/td&gt;
					&lt;td&gt;Qwen3.5-Plus 或 MiMo V2.5&lt;/td&gt;
					&lt;td&gt;Pro 版不支持&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预算敏感&lt;/td&gt;
					&lt;td&gt;DeepSeek V4-Pro（限时折扣）&lt;/td&gt;
					&lt;td&gt;折扣期间性价比也不错&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;一句话&lt;/strong&gt;：如果你的场景是 Agent 自动化和代码生成，MiMo V2.5-Pro 的性价比目前很难被超越。但通识推理的短板是真实存在的，不适合所有场景。&lt;/p&gt;
&lt;p&gt;30天长测最大的收获是搞清楚了&lt;strong&gt;它适合做什么、不适合做什么&lt;/strong&gt;。模型选型的关键是匹配你的具体场景。&lt;/p&gt;
&lt;hr&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;备选标题&lt;/strong&gt;（供公众号选用）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用了30天小米推理模型，这些坑官方文档不会告诉你&lt;/li&gt;
&lt;li&gt;MiMo v2.5-Pro 长测30天：Agent 能力确实强，但这几个问题必须说&lt;/li&gt;
&lt;li&gt;小米推理模型到底行不行？30天高强度实测给你答案&lt;/li&gt;
&lt;/ol&gt;

 &lt;/blockquote&gt;</description></item></channel></rss>