<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>MiMo on Kalend's Blog</title><link>https://blog.kalend.top/tags/mimo/</link><description>Recent content in MiMo on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Tue, 11 Aug 2026 09:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/mimo/index.xml" rel="self" type="application/rss+xml"/><item><title>MiMo v2.5-Pro长测30天：小米推理模型的真实能力边界</title><link>https://blog.kalend.top/2026/08/11/2026-08-11-mimo-v25-pro-30day-review.html/</link><pubDate>Tue, 11 Aug 2026 09:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/11/2026-08-11-mimo-v25-pro-30day-review.html/</guid><description>&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;用了30天，我的判断是：&lt;strong&gt;MiMo v2.5-Pro 是目前性价比最高的 Agent 模型，但不是万能模型。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Agent 能力全球开源第一、Token 效率比竞品省 40-60%、缓存命中价低到 ¥0.025/百万 token——这些数据都是真的。但通识推理比 DeepSeek 差 20 分、多源信息合成时会编造不存在的产品、缓存命中率远达不到官方声称的 89%——这些坑也是真的。&lt;/p&gt;
&lt;p&gt;30天下来，我总结出一个选型原则：&lt;strong&gt;Agent/自动化场景优先考虑 MiMo，知识密集型任务换别的模型。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="我的使用场景"&gt;我的使用场景
&lt;/h2&gt;&lt;p&gt;过去30天，我把 MiMo v2.5-Pro 接入了日常工作流的全部环节：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;每日内容选题、写稿、审校&lt;/li&gt;
&lt;li&gt;技术调研和竞品分析&lt;/li&gt;
&lt;li&gt;Python/Shell/JavaScript 代码生成与调试&lt;/li&gt;
&lt;li&gt;运维自动化（定时任务编排、部署流水线）&lt;/li&gt;
&lt;li&gt;知识库管理和记忆检索&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;日均消耗约 50-80 万 token，30天累计超过 1500 万 token。不是跑 benchmark，是真刀真枪干活。&lt;/p&gt;
&lt;h2 id="模型基本面"&gt;模型基本面
&lt;/h2&gt;&lt;p&gt;先摆参数，后面所有结论都基于这个基础：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;MiMo-V2.5-Pro&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;厂商&lt;/td&gt;
					&lt;td&gt;小米 Core AI 团队&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布&lt;/td&gt;
					&lt;td&gt;2026年4月27日&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;MoE，1.02T 总参 / 42B 激活&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文&lt;/td&gt;
					&lt;td&gt;1M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;最大输出&lt;/td&gt;
					&lt;td&gt;128K tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源&lt;/td&gt;
					&lt;td&gt;MIT&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;架构上是典型的 MoE（混合专家），总参数万亿级但每次推理只激活 42B，这就是它便宜的原因之一。&lt;/p&gt;
&lt;h2 id="四款国产模型横评"&gt;四款国产模型横评
&lt;/h2&gt;&lt;p&gt;30天里我同时用过 DeepSeek V4-Pro、Kimi K2.6 和 GLM-5.1，直接上对比表：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;MiMo V2.5-Pro&lt;/th&gt;
					&lt;th&gt;DeepSeek V4-Pro&lt;/th&gt;
					&lt;th&gt;Kimi K2.6&lt;/th&gt;
					&lt;th&gt;GLM-5.1&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Agent 能力&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1581&lt;/strong&gt; (GDPVal-AA)&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td&gt;57.2%&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;58.6%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;58.4%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;MMLU-Pro&lt;/td&gt;
					&lt;td&gt;68.5%&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;87.5%&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入价/百万token&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥3&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥12（限时¥3）&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;缓存命中价&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥0.025&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥1.2&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;1M&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
					&lt;td&gt;202K&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Token 效率&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;最优&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;次优&lt;/td&gt;
					&lt;td&gt;比 MiMo 多 85%&lt;/td&gt;
					&lt;td&gt;比 MiMo 多 20%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一句话总结：&lt;strong&gt;MiMo 在 Agent 场景碾压，但在 MMLU-Pro 这类通识考试上被 DeepSeek 和 Qwen 拉开 20 分差距。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="30天验证的6个真实优势"&gt;30天验证的6个真实优势
&lt;/h2&gt;&lt;h3 id="1-token-效率是真的省"&gt;1. Token 效率是真的省
&lt;/h3&gt;&lt;p&gt;这是最直观的感受。做同样的任务，MiMo 的 Token 消耗比 Claude Sonnet 少 40-60%。VentureBeat、dayahimour.org、Superculture 三个独立来源都确认了这个数字。&lt;/p&gt;
&lt;p&gt;体现在账单上更明显——缓存命中价 ¥0.025/百万 token，比 DeepSeek 的 ¥1.2 便宜 48 倍。一个月下来，我的 API 账单大概只有之前用 DeepSeek 的 1/3。&lt;/p&gt;
&lt;h3 id="2-代码能力扎实"&gt;2. 代码能力扎实
&lt;/h3&gt;&lt;p&gt;Python、Shell、JavaScript 的代码生成都很可靠。工具调用错误率低（平均 2.82%），结构化输出基本能用。&lt;/p&gt;
&lt;p&gt;日常的运维脚本、数据处理脚本、API 对接代码，MiMo 生成的质量和 DeepSeek 差不多，但 Token 消耗少很多。这是它性价比高的核心原因。&lt;/p&gt;
&lt;h3 id="3-中文表达自然"&gt;3. 中文表达自然
&lt;/h3&gt;&lt;p&gt;这一点比 Claude 和 GPT 都好。MiMo 生成的中文没有那种翻译腔，用词和句式都比较地道。写公众号文章时 AI 味明显更低，审校时需要改的地方更少。&lt;/p&gt;
&lt;h3 id="4-1m-上下文是真能用"&gt;4. 1M 上下文是真能用
&lt;/h3&gt;&lt;p&gt;不是所有标 1M 的模型都能真的处理 100 万 token。MiMo 的长上下文在实际使用中表现稳定，我在处理长文档和多轮对话时没有遇到上下文丢失的问题。&lt;/p&gt;
&lt;h3 id="5-推理稳定"&gt;5. 推理稳定
&lt;/h3&gt;&lt;p&gt;复杂任务规划、多步骤决策、条件分支判断——这些场景下 MiMo 的表现很一致，不会出现&amp;quot;上一步还行下一步就飞了&amp;quot;的情况。&lt;/p&gt;
&lt;h3 id="6-生态适配广"&gt;6. 生态适配广
&lt;/h3&gt;&lt;p&gt;OpenRouter 上 MiMo 的流量排名靠前，DeepInfra、Xiaomi 直连、AtlasCloud 等多个提供商都有部署。选提供商时有冗余，不会被单一节点卡死。&lt;/p&gt;
&lt;h2 id="30天踩过的5个坑必须诚实说"&gt;30天踩过的5个坑（必须诚实说）
&lt;/h2&gt;&lt;h3 id="坑1多源信息合成会幻觉最严重"&gt;坑1：多源信息合成会幻觉（最严重）
&lt;/h3&gt;&lt;p&gt;这是 30 天里最惊悚的一次。我在做选题推荐时，让模型同时处理 HN、V2EX、Product Hunt、HuggingFace、arXiv、Dev.to 六个平台的热门数据。&lt;/p&gt;
&lt;p&gt;输出 5 个推荐选题，其中 4 个存在幻觉：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;编造了一个不存在的模型&amp;quot;Meta Muse Glimmer 30B&amp;quot;&lt;/li&gt;
&lt;li&gt;编造了具体的数字&amp;quot;HN score 1023&amp;quot;&lt;/li&gt;
&lt;li&gt;编造了根本不存在的产品名称&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;根因&lt;/strong&gt;：大量异构数据同时输入时，模型容易把不同来源的信息混搭，生成看似合理但完全虚构的内容。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;教训&lt;/strong&gt;：凡是涉及&amp;quot;从多个来源汇总信息&amp;quot;的任务，必须逐条验证。不能信任模型给出的具体数字和产品名。&lt;/p&gt;
&lt;h3 id="坑2通识推理是明显短板"&gt;坑2：通识推理是明显短板
&lt;/h3&gt;&lt;p&gt;MMLU-Pro 只有 68.5%，DeepSeek V4-Pro 是 87.5%，差了将近 20 分。GPQA-Diamond 也类似，MiMo 66.7% vs Qwen3.5-Plus 88.4%。&lt;/p&gt;
&lt;p&gt;实际体感：问一些需要广泛知识储备的问题（比如解释某个物理概念、分析某个历史事件），MiMo 的回答深度明显不如 DeepSeek。它更像一个&amp;quot;做事的模型&amp;quot;而不是&amp;quot;博学的模型&amp;quot;。&lt;/p&gt;
&lt;h3 id="坑3长任务偶尔中断"&gt;坑3：长任务偶尔中断
&lt;/h3&gt;&lt;p&gt;社区评测里提到的&amp;quot;长时间任务生成中断&amp;quot;，我自己也遇到过。特别是在处理大量文件或复杂编排任务时，偶尔会突然中断输出。&lt;/p&gt;
&lt;p&gt;不是每次都发生，但概率不低。对于需要持续运行的自动化任务，这是个风险点，需要做好重试和断点续传的逻辑。&lt;/p&gt;
&lt;h3 id="坑4缓存命中率名不副实"&gt;坑4：缓存命中率名不副实
&lt;/h3&gt;&lt;p&gt;官方声称缓存命中率约 89%，TRAE 社区实测约 40%，我的使用体验也差不多。&lt;/p&gt;
&lt;p&gt;这意味着实际账单会比理论计算高不少。如果按 89% 命中率算成本，实际可能只有一半多的请求命中缓存，成本直接翻倍。定价虽然便宜，但不要按最理想情况做预算。&lt;/p&gt;
&lt;h3 id="坑5pro-版不支持多模态"&gt;坑5：Pro 版不支持多模态
&lt;/h3&gt;&lt;p&gt;MiMo-V2.5-Pro 是纯文本模型。需要理解图片、音频、视频时，必须切换到 V2.5 基础版。&lt;/p&gt;
&lt;p&gt;这在实际使用中是个麻烦。比如让我分析一张截图里的数据，Pro 版直接报错，得手动切模型。如果你的工作流涉及多模态输入，要提前规划好模型切换策略。&lt;/p&gt;
&lt;h2 id="定价真正的价格屠夫"&gt;定价：真正的价格屠夫
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;输入/百万token&lt;/th&gt;
					&lt;th&gt;输出/百万token&lt;/th&gt;
					&lt;th&gt;缓存命中&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;¥3&lt;/td&gt;
					&lt;td&gt;¥6&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;¥0.025&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V4-Pro&lt;/td&gt;
					&lt;td&gt;¥12（限时¥3）&lt;/td&gt;
					&lt;td&gt;¥24（限时¥6）&lt;/td&gt;
					&lt;td&gt;¥1.2&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.1&lt;/td&gt;
					&lt;td&gt;~¥10&lt;/td&gt;
					&lt;td&gt;~¥32&lt;/td&gt;
					&lt;td&gt;—&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;缓存命中价 ¥0.025/百万 token，降幅 99%。&lt;/p&gt;
&lt;p&gt;小米的降价逻辑来自推理系统优化：基于 SGLang HiCache，KV Cache 在 GPU/CPU/SSD 多级存储间的传输量降到优化前的 1/7，可缓存 Token 数提高到 5 倍。&lt;/p&gt;
&lt;h2 id="到底该不该用"&gt;到底该不该用？
&lt;/h2&gt;&lt;p&gt;30天下来，我的选型逻辑变成了这样：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;推荐模型&lt;/th&gt;
					&lt;th&gt;理由&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Agent / 自动化任务&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;Agent 能力开源第一，Token 效率最优&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代码生成 / 脚本&lt;/td&gt;
					&lt;td&gt;&lt;strong&gt;MiMo V2.5-Pro&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;可靠且便宜&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;通识推理 / 科学问答&lt;/td&gt;
					&lt;td&gt;DeepSeek V4-Pro 或 Qwen3.5&lt;/td&gt;
					&lt;td&gt;MMLU-Pro 差距 20+ 分&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;中文内容创作&lt;/td&gt;
					&lt;td&gt;MiMo V2.5-Pro&lt;/td&gt;
					&lt;td&gt;中文表达自然，AI 味低&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多模态理解&lt;/td&gt;
					&lt;td&gt;Qwen3.5-Plus 或 MiMo V2.5&lt;/td&gt;
					&lt;td&gt;Pro 版不支持&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;预算敏感&lt;/td&gt;
					&lt;td&gt;DeepSeek V4-Pro（限时折扣）&lt;/td&gt;
					&lt;td&gt;折扣期间性价比也不错&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;一句话&lt;/strong&gt;：如果你的场景是 Agent 自动化和代码生成，MiMo V2.5-Pro 的性价比目前很难被超越。但通识推理的短板是真实存在的，不适合所有场景。&lt;/p&gt;
&lt;p&gt;30天长测最大的收获是搞清楚了&lt;strong&gt;它适合做什么、不适合做什么&lt;/strong&gt;。模型选型的关键是匹配你的具体场景。&lt;/p&gt;
&lt;hr&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;备选标题&lt;/strong&gt;（供公众号选用）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;用了30天小米推理模型，这些坑官方文档不会告诉你&lt;/li&gt;
&lt;li&gt;MiMo v2.5-Pro 长测30天：Agent 能力确实强，但这几个问题必须说&lt;/li&gt;
&lt;li&gt;小米推理模型到底行不行？30天高强度实测给你答案&lt;/li&gt;
&lt;/ol&gt;

 &lt;/blockquote&gt;</description></item></channel></rss>