<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>多模态 on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/</link><description>Recent content in 多模态 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Sun, 16 Aug 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E5%A4%9A%E6%A8%A1%E6%80%81/index.xml" rel="self" type="application/rss+xml"/><item><title>27B模型编程能力碾压自家Plus：Qwen3.8悄悄开源了一个怪东西</title><link>https://blog.kalend.top/2026/08/16/2026-08-16-qwen38-27b-release.html/</link><pubDate>Sun, 16 Aug 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/16/2026-08-16-qwen38-27b-release.html/</guid><description>&lt;p&gt;上周四阿里悄悄开源了一个模型，没搞发布会，没写博客，直接把权重扔到了HuggingFace。结果HN冲到1061分，HF两天拿到9292个赞。&lt;/p&gt;
&lt;p&gt;核心冲突点在于：这个27B参数的小模型，在编程benchmark上把自家更大的Qwen3.7-Plus按在地上摩擦。小模型打大模型，不是偶尔赢一两个指标，是全面碾压。&lt;/p&gt;
&lt;p&gt;一句话定位：&lt;strong&gt;这是目前最强的27B开源模型，专为编程和Agent场景设计。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="架构创新64层里塞了48层线性注意力"&gt;架构创新：64层里塞了48层线性注意力
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B最核心的变化不是参数量，而是架构。&lt;/p&gt;
&lt;p&gt;传统Transformer每一层都用全注意力（Full Attention），计算量随序列长度平方增长——O(n²)。序列越长，显存和计算开销越大。&lt;/p&gt;
&lt;p&gt;Qwen3.8用了混合架构：64层中&lt;strong&gt;48层是Gated DeltaNet线性注意力&lt;/strong&gt;，只有&lt;strong&gt;16层保留全注意力&lt;/strong&gt;。线性注意力的计算复杂度是O(n)，长序列下效率远高于传统方案。&lt;/p&gt;
&lt;p&gt;为什么这样设计？因为大部分token之间的关系其实不需要O(n²)的计算量来捕获。线性注意力处理局部和短期依赖，全注意力在关键位置恢复全局交互能力。两者配合，既保证了模型能力，又大幅降低了长序列的计算开销。&lt;/p&gt;
&lt;p&gt;结果是：KV cache更小，长序列处理更高效，27B参数能塞进16GB显存。原生支持262K tokens上下文，用YaRN可外推到1M。&lt;/p&gt;
&lt;p&gt;此外，Qwen3.8-27B是原生多模态模型，支持文本、图像、视频输入。不是在语言模型上套个视觉编码器那种拼凑方案，而是从架构层面就设计了多模态支持。&lt;/p&gt;
&lt;h2 id="编程能力暴涨小模型打大模型"&gt;编程能力暴涨：小模型打大模型
&lt;/h2&gt;&lt;p&gt;这是Qwen3.8-27B最炸裂的部分。&lt;/p&gt;
&lt;p&gt;先看编程核心benchmark（数据来自Qwen官方model card，2026-08-14发布）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Benchmark&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.6-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.7-Plus&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;TerminalBench 2.1&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;73.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;63.4&lt;/td&gt;
					&lt;td style="text-align: center"&gt;64.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;61.7&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;53.5&lt;/td&gt;
					&lt;td style="text-align: center"&gt;57.6&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LiveCodeBench v6&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;90.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;83.9&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;QwenSWEBench&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;79.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;49.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TerminalBench从63.4到73.0，提升15%；SWE-bench Pro从53.5到61.7，同样提升15%。&lt;/p&gt;
&lt;p&gt;但真正的重头戏是&lt;strong&gt;DeepSWE 1.1&lt;/strong&gt;：从Qwen3.6-27B的13.3直接飙到42.2，&lt;strong&gt;提升217%&lt;/strong&gt;。DeepSWE测的是Agent编程能力——模型自主读代码、改代码、提交PR的全流程。三倍多的涨幅说明Qwen3.8在工具调用和代码理解上做了根本性改进。&lt;/p&gt;
&lt;p&gt;关键对比：&lt;strong&gt;Qwen3.8-27B的编程分数全面超越了自家上一代旗舰Qwen3.7-Plus。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;一个27B的小模型，编程能力比Plus版本还强。这不是小步快跑，是换了个台阶。&lt;/p&gt;
&lt;h2 id="多模态编程超越claude-opus"&gt;多模态编程：超越Claude Opus
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B不只是文本编程强。作为原生多模态模型，它在&lt;strong&gt;看图写代码&lt;/strong&gt;这个场景上也拿出了惊人成绩。&lt;/p&gt;
&lt;p&gt;SWE-MM（多模态编程benchmark）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th style="text-align: center"&gt;SWE-MM分数&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.8-27B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;38.6&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.7-Plus&lt;/td&gt;
					&lt;td style="text-align: center"&gt;30.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Opus 4.6 Max&lt;/td&gt;
					&lt;td style="text-align: center"&gt;27.1&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;38.6 vs 27.1，Qwen3.8-27B在多模态编程上&lt;strong&gt;超越了Claude Opus 4.6 Max&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;SWE-MM的测试方式是给模型看截图、UI设计稿、错误日志截图等视觉信息，让模型基于这些视觉输入写代码或修复bug。这个场景在实际开发中非常常见——产品经理扔个截图过来，你得看懂然后写代码实现。&lt;/p&gt;
&lt;p&gt;一个27B的开源模型，在这个任务上打赢了闭源顶级模型。意义不言自明。&lt;/p&gt;
&lt;h2 id="16gb显卡可跑消费级硬件的本地部署"&gt;16GB显卡可跑：消费级硬件的本地部署
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B的参数量是27.8B（Dense架构），官方提供BF16和FP8两种权重格式。&lt;/p&gt;
&lt;p&gt;本地部署的现实情况：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;部署方式&lt;/th&gt;
					&lt;th style="text-align: center"&gt;显存需求&lt;/th&gt;
					&lt;th&gt;可用显卡&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP8全精度&lt;/td&gt;
					&lt;td style="text-align: center"&gt;~28GB&lt;/td&gt;
					&lt;td&gt;RTX 4090、A100&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit量化（GGUF）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;~16GB&lt;/td&gt;
					&lt;td&gt;RTX 4060 Ti 16GB、RTX 4070&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CPU推理（GGUF）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;内存32GB+&lt;/td&gt;
					&lt;td&gt;任何机器，速度慢&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;16GB显卡跑4-bit量化版，是目前最现实的本地部署方案。社区已经完成了GGUF转换（unsloth等项目），Ollama也已适配。&lt;/p&gt;
&lt;p&gt;262K的原生上下文很诱人，但要注意：跑满262K需要的显存远超16GB。4-bit量化+中等上下文（32K-64K）是消费级硬件的实际上限。&lt;/p&gt;
&lt;p&gt;推理框架方面，vLLM、SGLang已支持，社区反馈推理速度比上一代有明显提升，得益于线性注意力带来的KV cache优化。&lt;/p&gt;
&lt;h2 id="本周第三个重磅开源模型"&gt;本周第三个重磅开源模型
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B不是孤立事件。本周（8月10-14日）是开源模型的爆发周：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;日期&lt;/th&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th style="text-align: center"&gt;参数量&lt;/th&gt;
					&lt;th&gt;亮点&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;8月10日&lt;/td&gt;
					&lt;td&gt;Meta Muse Glimmer 30B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;29.6B&lt;/td&gt;
					&lt;td&gt;端侧Agent模型，Apache 2.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;8月13日&lt;/td&gt;
					&lt;td&gt;NVIDIA Nemotron 3.5 Lightning&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
					&lt;td&gt;推理加速，消费级优化&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;8月14日&lt;/td&gt;
					&lt;td&gt;Qwen3.8-27B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;27.8B&lt;/td&gt;
					&lt;td&gt;编程能力暴涨，混合注意力架构&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三个模型都瞄准27-30B参数区间，都走Apache 2.0完全开源，都在消费级硬件上做优化。&lt;/p&gt;
&lt;p&gt;趋势很明显：&lt;strong&gt;27-30B正在成为开源模型的甜点区。&lt;/strong&gt; 够大，能力不弱；够小，消费级显卡能跑。这个区间直接对标的是本地部署市场——不想把代码和数据交给云端API的开发者和企业。&lt;/p&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B重新定义了27B开源模型的能力上限。混合线性注意力架构是真正的技术创新，不是换个数据集训一遍就叫&amp;quot;新一代&amp;quot;。&lt;/p&gt;
&lt;p&gt;实操建议：如果你有16GB以上显卡，值得试试4-bit量化版本。编程助手、代码review、Agent任务，这三个场景Qwen3.8-27B目前在同级别没有对手。&lt;/p&gt;
&lt;p&gt;所有数据来自Qwen官方model card，第三方独立验证尚未完成。建议关注后续社区测评结果。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;作者：varkm&lt;/p&gt;

 &lt;/blockquote&gt;</description></item></channel></rss>