<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Kimi K3 on Kalend's Blog</title><link>https://blog.kalend.top/categories/kimi-k3/</link><description>Recent content in Kimi K3 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Thu, 30 Jul 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/categories/kimi-k3/index.xml" rel="self" type="application/rss+xml"/><item><title>Kimi K3 实测：2.8万亿参数开源模型，能打Claude Opus吗？</title><link>https://blog.kalend.top/2026/07/30/2026-07-30-kimi-k3-review.html/</link><pubDate>Thu, 30 Jul 2026 08:30:00 +0800</pubDate><guid>https://blog.kalend.top/2026/07/30/2026-07-30-kimi-k3-review.html/</guid><description>&lt;p&gt;先说结论：Kimi K3 是国产大模型第一次真正挤进全球第一梯队，值得开发者认真对待。&lt;/p&gt;
&lt;h2 id="waic-2026-的重磅炸弹"&gt;WAIC 2026 的重磅炸弹
&lt;/h2&gt;&lt;p&gt;7月16日，WAIC 2026开幕前夕，月之暗面发布了Kimi K3。2.8万亿参数，开源，Modified MIT许可证。Arena联合创始人直接说这是&amp;quot;今年最重要的一次模型发布&amp;quot;。&lt;/p&gt;
&lt;p&gt;这话不是客套。看数据就知道——Arena Agent榜第4名，和Claude Opus 4.8、GPT-5.6 Sol同分段；Arena前端开发榜直接拿第1，1679分，领先Claude Fable 5整整48分。一个开源模型在编程赛道上把所有闭源选手都压在身下，这在之前从没发生过。&lt;/p&gt;
&lt;p&gt;在此之前，国产模型在全球排行榜上的最好成绩大概是GLM-5.2的&amp;quot;接近Opus水平&amp;quot;。K3直接跳过了&amp;quot;接近&amp;quot;，做到了&amp;quot;并列&amp;quot;。这一步的跨度比很多人想象的要大。&lt;/p&gt;
&lt;h2 id="k3-到底是什么"&gt;K3 到底是什么
&lt;/h2&gt;&lt;p&gt;先理清几个关键参数：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数值&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;参数规模&lt;/td&gt;
					&lt;td&gt;2.8万亿（2.8T），MoE架构&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;上下文窗口&lt;/td&gt;
					&lt;td&gt;1,048,576 tokens（1M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;多模态&lt;/td&gt;
					&lt;td&gt;原生视觉理解&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;Modified MIT&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026年7月16日&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;2.8T的MoE架构意味着什么？对比一下：DeepSeek V4-Pro是1.6T参数，K3比它大了约75%。但MoE不是全部参数同时激活，每次推理只激活一部分专家网络，所以推理成本和全连接的密集模型不是一个量级。这也是为什么参数量能做到这么大，同时上下文还能撑到100万token——原生支持，不是外挂式扩展。&lt;/p&gt;
&lt;p&gt;MoE架构的核心优势在于&amp;quot;大容量、低成本&amp;quot;。模型可以存储海量知识在参数中，但每次调用只用到其中一小部分。这就像一个图书馆有百万本书，但你每次只需要翻开其中几本。K3把这个思路推到了极致——2.8万亿参数里装的知识密度，理论上应该远超1.6T的DeepSeek V4-Pro。&lt;/p&gt;
&lt;h2 id="跑分开源第一闭源并列"&gt;跑分：开源第一，闭源并列
&lt;/h2&gt;&lt;p&gt;直接上硬数据：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Arena Agent榜&lt;/strong&gt;：第4名，与Claude Opus 4.8和GPT-5.6 Sol同分数段。Arena的Agent榜考的是模型作为自主Agent的能力——给一个复杂任务，模型需要自己规划步骤、调用工具、解决问题。这意味着在通用Agent能力上，K3已经和OpenAI、Anthropic的旗舰模型站在同一台阶。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Arena前端开发榜&lt;/strong&gt;：第1名，1679分。这个榜专门考前端代码生成，K3甩开第二名Claude Fable 5整整48分。Kimi系列从前几代就以前端能力著称，K3把这个优势进一步拉大了。48分的差距在Arena的评分体系里是非常显著的——通常相邻名次之间只差几分。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;SWE-bench Pro&lt;/strong&gt;：58.6%，开源模型第一。SWE-bench Pro考的是真实GitHub issue修复能力，给模型一个真实的代码仓库和一个bug报告，看它能不能自己定位问题、写出修复代码。58.6%意味着超过一半的真实软件工程问题它能独立解决。这个数字比很多初级开发者的表现还要好。&lt;/p&gt;
&lt;p&gt;数据来源：Arena排行榜（lmarena.ai）和SWE-bench官方评测。这些数据都是公开可查的，不是厂商自己跑的私有评测。&lt;/p&gt;
&lt;h2 id="开发者视角api和工具链"&gt;开发者视角：API和工具链
&lt;/h2&gt;&lt;p&gt;光跑分好看没用，开发者关心的是能不能直接上手。K3在这方面做了不少功课。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;API定价&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;类型&lt;/th&gt;
					&lt;th&gt;价格&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;输入（cache miss）&lt;/td&gt;
					&lt;td&gt;$3.00/M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输入（cache hit）&lt;/td&gt;
					&lt;td&gt;$0.30/M tokens&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;输出&lt;/td&gt;
					&lt;td&gt;$15.00/M tokens&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;对比Claude Opus 4.8的输入$15/M，K3的输入价格只有它的五分之一。cache命中时更是低到$0.30/M——根据月之暗面官方数据，编码场景的缓存命中率可以超过90%，实际成本会非常低。&lt;/p&gt;
&lt;p&gt;举个具体例子：假设你用K3写一个中等复杂度的代码生成任务，输入2000 tokens、输出5000 tokens，cache命中时一次调用成本约$0.076。同样的任务用Opus 4.8，成本约$0.105，贵了38%。如果是高频调用的Agent场景，这个差距会被放大到几倍甚至十几倍。&lt;/p&gt;
&lt;p&gt;API接入方式很标准：&lt;code&gt;https://api.moonshot.ai/v1&lt;/code&gt;，模型ID &lt;code&gt;kimi-k3&lt;/code&gt;，兼容OpenAI SDK格式。这意味着如果你之前用OpenAI的SDK写代码，只需要改一下base_url和api_key就能切换到K3。OpenRouter上也能用，地址是&lt;code&gt;openrouter.ai/moonshotai/kimi-k3&lt;/code&gt;，适合想先试用再决定的开发者。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;配套工具方面&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Kimi Code&lt;/strong&gt;：官方编程工具，支持Swarm多Agent并行模式。Swarm是K3的原生特性，可以同时启动多个Agent协作完成复杂任务，这在其他模型上通常需要自己搭建编排框架&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Goal长程任务&lt;/strong&gt;：官方演示了48小时连续自主运行完成芯片设计的案例。这种长时间自主执行能力对需要持续迭代的工程任务很有价值，比如大型代码重构、数据分析流水线&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Tool Calling&lt;/strong&gt;：支持标准工具调用，可接入Cursor、Continue等第三方IDE工具。对于已经习惯在IDE里用AI辅助编程的开发者，切换成本很低&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要注意的是，要使用完整的100万token上下文，需要在配置中手动设置context window为1048576，否则可能只用到默认的较短上下文。这个坑我在测试时踩过——一开始只用了默认配置，结果发现长文档处理能力远不如预期，后来才发现是没有用满上下文窗口。&lt;/p&gt;
&lt;h2 id="与竞品的正面交锋"&gt;与竞品的正面交锋
&lt;/h2&gt;&lt;p&gt;把几个主流模型拉到一起比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th&gt;参数&lt;/th&gt;
					&lt;th&gt;上下文&lt;/th&gt;
					&lt;th&gt;API输入价格&lt;/th&gt;
					&lt;th&gt;编程排名&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Kimi K3&lt;/td&gt;
					&lt;td&gt;2.8T&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;$3/M&lt;/td&gt;
					&lt;td&gt;Arena前端#1&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Opus 4.8&lt;/td&gt;
					&lt;td&gt;未公开&lt;/td&gt;
					&lt;td&gt;200K&lt;/td&gt;
					&lt;td&gt;$15/M&lt;/td&gt;
					&lt;td&gt;Agent#4同级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GPT-5.6 Sol&lt;/td&gt;
					&lt;td&gt;未公开&lt;/td&gt;
					&lt;td&gt;128K&lt;/td&gt;
					&lt;td&gt;$5/M&lt;/td&gt;
					&lt;td&gt;Agent#4同级&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSeek V4-Pro&lt;/td&gt;
					&lt;td&gt;1.6T&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;¥2/M&lt;/td&gt;
					&lt;td&gt;较低&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;GLM-5.2&lt;/td&gt;
					&lt;td&gt;745B MoE&lt;/td&gt;
					&lt;td&gt;1M&lt;/td&gt;
					&lt;td&gt;¥5/M&lt;/td&gt;
					&lt;td&gt;接近Opus&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;几个观察：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;上下文领先&lt;/strong&gt;：1M上下文与DeepSeek V4-Pro、GLM-5.2同级，但远超Claude的200K和GPT的128K。处理超长文档、代码库分析时优势明显。比如分析一个10万行的代码库，K3可以一次塞进去，其他模型要么分段要么丢上下文。在实际开发中，这意味着你可以把整个项目的代码一次性喂给K3，让它理解全局架构后再做修改，而不是每次只能给它看一个文件。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;价格优势明显&lt;/strong&gt;：输入价格只有Opus的1/5，GPT-5.6的60%。加上缓存命中率，实际使用成本更低。对于创业公司和个人开发者来说，这个价格差距可能决定了能不能在预算内完成项目。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;开源是杀手锏&lt;/strong&gt;：Modified MIT协议意味着可以商用、可以微调、可以本地部署。闭源模型做不到这一点。对于有数据安全要求的企业，这一点可能比跑分更重要——你的代码和数据不需要发送到外部API。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;DeepSeek价格更低&lt;/strong&gt;：如果纯看成本，DeepSeek V4-Pro的¥2/M仍然更便宜，但能力和K3不在一个量级。选DeepSeek还是K3，本质上是&amp;quot;够用就好&amp;quot;和&amp;quot;追求最好&amp;quot;的区别。&lt;/p&gt;
&lt;h2 id="实际使用建议"&gt;实际使用建议
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;什么场景适合用K3？&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要处理超长上下文的任务（法律文档、代码库分析、长对话）&lt;/li&gt;
&lt;li&gt;前端代码生成（排行榜第一不是白给的）&lt;/li&gt;
&lt;li&gt;需要开源协议的商业项目&lt;/li&gt;
&lt;li&gt;成本敏感但对能力有要求的场景&lt;/li&gt;
&lt;li&gt;多Agent协作任务（Swarm模式是原生支持的）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;什么场景可能还是Opus/GPT更好？&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;需要极强推理能力的复杂逻辑任务（Arena Agent榜Opus和K3同分，但细分维度可能有差异）&lt;/li&gt;
&lt;li&gt;已经深度集成Claude/GPT生态的项目，切换成本高&lt;/li&gt;
&lt;li&gt;需要Claude的超长稳定输出的场景（Opus在长文本生成的稳定性上仍有口碑）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;接入建议&lt;/strong&gt;：先通过OpenRouter试用，验证能力是否满足需求。如果决定深度使用，直接走Moonshot官方API，利用缓存机制降低成本。对于开源部署，需要关注完整权重的发布时间（官方表示7月27日前发布）。&lt;/p&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;Kimi K3的意义不只是&amp;quot;又一个很强的模型&amp;quot;。它是国产开源模型第一次在全球排行榜上和OpenAI、Anthropic的旗舰产品平起平坐。2.8万亿参数、100万上下文、Arena前端第一、SWE-bench开源第一——这些不是PPT上的数字，是可验证的跑分结果。&lt;/p&gt;
&lt;p&gt;对开发者来说，最实际的影响是：你的模型选择菜单里多了一个真正有竞争力的选项。价格比Opus便宜5倍，上下文比GPT和Claude长数倍，还开源。要不要上车取决于你的具体需求，但至少现在值得花一个下午认真试一试。&lt;/p&gt;
&lt;p&gt;月之暗面从Kimi K1到K3的迭代速度很快，每一代都在编程能力上有明显提升。如果这个趋势持续下去，闭源模型的定价策略恐怕要重新考虑了。&lt;/p&gt;</description></item></channel></rss>