<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>编程 on Kalend's Blog</title><link>https://blog.kalend.top/tags/%E7%BC%96%E7%A8%8B/</link><description>Recent content in 编程 on Kalend's Blog</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Sun, 16 Aug 2026 08:00:00 +0800</lastBuildDate><atom:link href="https://blog.kalend.top/tags/%E7%BC%96%E7%A8%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>27B模型编程能力碾压自家Plus：Qwen3.8悄悄开源了一个怪东西</title><link>https://blog.kalend.top/2026/08/16/2026-08-16-qwen38-27b-release.html/</link><pubDate>Sun, 16 Aug 2026 08:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/16/2026-08-16-qwen38-27b-release.html/</guid><description>&lt;p&gt;上周四阿里悄悄开源了一个模型，没搞发布会，没写博客，直接把权重扔到了HuggingFace。结果HN冲到1061分，HF两天拿到9292个赞。&lt;/p&gt;
&lt;p&gt;核心冲突点在于：这个27B参数的小模型，在编程benchmark上把自家更大的Qwen3.7-Plus按在地上摩擦。小模型打大模型，不是偶尔赢一两个指标，是全面碾压。&lt;/p&gt;
&lt;p&gt;一句话定位：&lt;strong&gt;这是目前最强的27B开源模型，专为编程和Agent场景设计。&lt;/strong&gt;&lt;/p&gt;
&lt;h2 id="架构创新64层里塞了48层线性注意力"&gt;架构创新：64层里塞了48层线性注意力
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B最核心的变化不是参数量，而是架构。&lt;/p&gt;
&lt;p&gt;传统Transformer每一层都用全注意力（Full Attention），计算量随序列长度平方增长——O(n²)。序列越长，显存和计算开销越大。&lt;/p&gt;
&lt;p&gt;Qwen3.8用了混合架构：64层中&lt;strong&gt;48层是Gated DeltaNet线性注意力&lt;/strong&gt;，只有&lt;strong&gt;16层保留全注意力&lt;/strong&gt;。线性注意力的计算复杂度是O(n)，长序列下效率远高于传统方案。&lt;/p&gt;
&lt;p&gt;为什么这样设计？因为大部分token之间的关系其实不需要O(n²)的计算量来捕获。线性注意力处理局部和短期依赖，全注意力在关键位置恢复全局交互能力。两者配合，既保证了模型能力，又大幅降低了长序列的计算开销。&lt;/p&gt;
&lt;p&gt;结果是：KV cache更小，长序列处理更高效，27B参数能塞进16GB显存。原生支持262K tokens上下文，用YaRN可外推到1M。&lt;/p&gt;
&lt;p&gt;此外，Qwen3.8-27B是原生多模态模型，支持文本、图像、视频输入。不是在语言模型上套个视觉编码器那种拼凑方案，而是从架构层面就设计了多模态支持。&lt;/p&gt;
&lt;h2 id="编程能力暴涨小模型打大模型"&gt;编程能力暴涨：小模型打大模型
&lt;/h2&gt;&lt;p&gt;这是Qwen3.8-27B最炸裂的部分。&lt;/p&gt;
&lt;p&gt;先看编程核心benchmark（数据来自Qwen官方model card，2026-08-14发布）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Benchmark&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.6-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.7-Plus&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;TerminalBench 2.1&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;73.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;63.4&lt;/td&gt;
					&lt;td style="text-align: center"&gt;64.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;61.7&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;53.5&lt;/td&gt;
					&lt;td style="text-align: center"&gt;57.6&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LiveCodeBench v6&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;90.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;83.9&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;QwenSWEBench&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;79.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;49.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;TerminalBench从63.4到73.0，提升15%；SWE-bench Pro从53.5到61.7，同样提升15%。&lt;/p&gt;
&lt;p&gt;但真正的重头戏是&lt;strong&gt;DeepSWE 1.1&lt;/strong&gt;：从Qwen3.6-27B的13.3直接飙到42.2，&lt;strong&gt;提升217%&lt;/strong&gt;。DeepSWE测的是Agent编程能力——模型自主读代码、改代码、提交PR的全流程。三倍多的涨幅说明Qwen3.8在工具调用和代码理解上做了根本性改进。&lt;/p&gt;
&lt;p&gt;关键对比：&lt;strong&gt;Qwen3.8-27B的编程分数全面超越了自家上一代旗舰Qwen3.7-Plus。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;一个27B的小模型，编程能力比Plus版本还强。这不是小步快跑，是换了个台阶。&lt;/p&gt;
&lt;h2 id="多模态编程超越claude-opus"&gt;多模态编程：超越Claude Opus
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B不只是文本编程强。作为原生多模态模型，它在&lt;strong&gt;看图写代码&lt;/strong&gt;这个场景上也拿出了惊人成绩。&lt;/p&gt;
&lt;p&gt;SWE-MM（多模态编程benchmark）：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th style="text-align: center"&gt;SWE-MM分数&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.8-27B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;38.6&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Qwen3.7-Plus&lt;/td&gt;
					&lt;td style="text-align: center"&gt;30.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Claude Opus 4.6 Max&lt;/td&gt;
					&lt;td style="text-align: center"&gt;27.1&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;38.6 vs 27.1，Qwen3.8-27B在多模态编程上&lt;strong&gt;超越了Claude Opus 4.6 Max&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;SWE-MM的测试方式是给模型看截图、UI设计稿、错误日志截图等视觉信息，让模型基于这些视觉输入写代码或修复bug。这个场景在实际开发中非常常见——产品经理扔个截图过来，你得看懂然后写代码实现。&lt;/p&gt;
&lt;p&gt;一个27B的开源模型，在这个任务上打赢了闭源顶级模型。意义不言自明。&lt;/p&gt;
&lt;h2 id="16gb显卡可跑消费级硬件的本地部署"&gt;16GB显卡可跑：消费级硬件的本地部署
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B的参数量是27.8B（Dense架构），官方提供BF16和FP8两种权重格式。&lt;/p&gt;
&lt;p&gt;本地部署的现实情况：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;部署方式&lt;/th&gt;
					&lt;th style="text-align: center"&gt;显存需求&lt;/th&gt;
					&lt;th&gt;可用显卡&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;FP8全精度&lt;/td&gt;
					&lt;td style="text-align: center"&gt;~28GB&lt;/td&gt;
					&lt;td&gt;RTX 4090、A100&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;4-bit量化（GGUF）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;~16GB&lt;/td&gt;
					&lt;td&gt;RTX 4060 Ti 16GB、RTX 4070&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CPU推理（GGUF）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;内存32GB+&lt;/td&gt;
					&lt;td&gt;任何机器，速度慢&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;16GB显卡跑4-bit量化版，是目前最现实的本地部署方案。社区已经完成了GGUF转换（unsloth等项目），Ollama也已适配。&lt;/p&gt;
&lt;p&gt;262K的原生上下文很诱人，但要注意：跑满262K需要的显存远超16GB。4-bit量化+中等上下文（32K-64K）是消费级硬件的实际上限。&lt;/p&gt;
&lt;p&gt;推理框架方面，vLLM、SGLang已支持，社区反馈推理速度比上一代有明显提升，得益于线性注意力带来的KV cache优化。&lt;/p&gt;
&lt;h2 id="本周第三个重磅开源模型"&gt;本周第三个重磅开源模型
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B不是孤立事件。本周（8月10-14日）是开源模型的爆发周：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;日期&lt;/th&gt;
					&lt;th&gt;模型&lt;/th&gt;
					&lt;th style="text-align: center"&gt;参数量&lt;/th&gt;
					&lt;th&gt;亮点&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;8月10日&lt;/td&gt;
					&lt;td&gt;Meta Muse Glimmer 30B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;29.6B&lt;/td&gt;
					&lt;td&gt;端侧Agent模型，Apache 2.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;8月13日&lt;/td&gt;
					&lt;td&gt;NVIDIA Nemotron 3.5 Lightning&lt;/td&gt;
					&lt;td style="text-align: center"&gt;-&lt;/td&gt;
					&lt;td&gt;推理加速，消费级优化&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;8月14日&lt;/td&gt;
					&lt;td&gt;Qwen3.8-27B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;27.8B&lt;/td&gt;
					&lt;td&gt;编程能力暴涨，混合注意力架构&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;三个模型都瞄准27-30B参数区间，都走Apache 2.0完全开源，都在消费级硬件上做优化。&lt;/p&gt;
&lt;p&gt;趋势很明显：&lt;strong&gt;27-30B正在成为开源模型的甜点区。&lt;/strong&gt; 够大，能力不弱；够小，消费级显卡能跑。这个区间直接对标的是本地部署市场——不想把代码和数据交给云端API的开发者和企业。&lt;/p&gt;
&lt;h2 id="结论"&gt;结论
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B重新定义了27B开源模型的能力上限。混合线性注意力架构是真正的技术创新，不是换个数据集训一遍就叫&amp;quot;新一代&amp;quot;。&lt;/p&gt;
&lt;p&gt;实操建议：如果你有16GB以上显卡，值得试试4-bit量化版本。编程助手、代码review、Agent任务，这三个场景Qwen3.8-27B目前在同级别没有对手。&lt;/p&gt;
&lt;p&gt;所有数据来自Qwen官方model card，第三方独立验证尚未完成。建议关注后续社区测评结果。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;作者：varkm&lt;/p&gt;

 &lt;/blockquote&gt;</description></item><item><title>Qwen 3.8 27B 昨天发布：编程能力暴涨217%，24GB显卡就能跑的新模型王</title><link>https://blog.kalend.top/2026/08/15/qwen38-27b-release.html/</link><pubDate>Sat, 15 Aug 2026 09:00:00 +0800</pubDate><guid>https://blog.kalend.top/2026/08/15/qwen38-27b-release.html/</guid><description>
 &lt;blockquote&gt;
 &lt;p&gt;昨天阿里发布了Qwen3.8-27B，HN评分飙到903。编程benchmark直接暴涨217%，但我建议你先看完注意事项再决定要不要上车。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;h2 id="先说结论"&gt;先说结论
&lt;/h2&gt;&lt;p&gt;这是目前27B级别里编程和Agent能力最强的开源模型，没有之一。但所有数据都是厂商自测，等第三方验证再冲不迟。&lt;/p&gt;
&lt;h2 id="一张表看懂升级了多少"&gt;一张表看懂升级了多少
&lt;/h2&gt;&lt;p&gt;对比对象是上一代Qwen3.6-27B，数据来自Qwen官方model card（2026-08-14发布）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;编程能力（核心战场）&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Benchmark&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.6-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;提升幅度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;DeepSWE 1.1（Agent编程）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;13.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;42.2&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;+217%&lt;/strong&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;QwenSWEBench（软件工程）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;49.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;79.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+60%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-MM（多模态编程）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;25.7&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;38.6&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+50%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;SWE-bench Pro&lt;/td&gt;
					&lt;td style="text-align: center"&gt;53.5&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;61.7&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+15%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Terminal-Bench 2.1（终端编码）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;63.4&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;73.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+15%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;NL2Repo-Bench（仓库生成）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;36.2&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;42.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+17%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;LiveCodeBench v6（竞赛编程）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;83.9&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;90.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+8%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;Agent和办公能力&lt;/strong&gt;&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Benchmark&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.6-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;提升幅度&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;OSWorld-Verified（桌面操控）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;63.9&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;84.3&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+32%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;WebArena-Verified（浏览器操控）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;48.8&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;64.8&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+33%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;CoWorkBench（长期办公任务）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;61.0&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;70.7&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+16%&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;AndroidWorld（手机操控）&lt;/td&gt;
					&lt;td style="text-align: center"&gt;70.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;81.9&lt;/strong&gt;&lt;/td&gt;
					&lt;td style="text-align: center"&gt;+17%&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;最炸裂的是DeepSWE：从13.3到42.2，涨了整整&lt;strong&gt;三倍多&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id="最值得关注的3个点"&gt;最值得关注的3个点
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;1. 编程能力不是小步快跑，是换了个台阶&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;DeepSWE +217%、QwenSWEBench +60%、SWE-MM +50%。&lt;/p&gt;
&lt;p&gt;这三个benchmark覆盖的场景不同：Agent编程、软件工程、多模态代码。说明不是某个指标刷分，而是全面升级。&lt;/p&gt;
&lt;p&gt;横向对比也猛：Qwen3.8-27B的编程分数超过了自家上一代旗舰Qwen3.7-Plus。&lt;/p&gt;
&lt;p&gt;DeepSWE 14.2→42.2，SWE-bench Pro 57.6→61.7。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;一个27B的小模型，编程能力碾压自家上一代Plus版本。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. reasoning_effort：终于能控制&amp;quot;想多久&amp;quot;了&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;新增xhigh/medium/low三档推理深度。默认xhigh，简单任务设low可以省token和时间。&lt;/p&gt;
&lt;p&gt;但官方文档里有一句话很重要：**在多轮Agent任务中，低推理深度不一定更快。**分析不够深入会导致重试增多，总耗时反而更高。&lt;/p&gt;
&lt;p&gt;这个功能目前需要推理框架支持（vLLM、SGLang等），普通Chat Completions API也支持，但实际效果取决于你怎么调参。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. 架构创新：64层里只有16层用全注意力&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这是最技术性的变化，也可能是最深远的。&lt;/p&gt;
&lt;p&gt;传统Transformer的每一层都用全注意力，计算量随序列长度平方增长。Qwen3.8用了一个混合架构：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;48层Gated DeltaNet（线性注意力）&lt;strong&gt;处理大部分计算，只在关键位置插入&lt;/strong&gt;16层全注意力&lt;/strong&gt;恢复token间交互能力。&lt;/p&gt;
&lt;p&gt;结果是KV cache更小，长序列处理更高效，理论上能处理更长的上下文而不爆显存。&lt;/p&gt;
&lt;p&gt;原生上下文262K tokens，用YaRN扩展到1M。这个数字够用，但真正跑262K需要的显存远超24GB。&lt;/p&gt;
&lt;h2 id="还能看什么多模态和通用能力"&gt;还能看什么：多模态和通用能力
&lt;/h2&gt;&lt;p&gt;Qwen3.8不只是编程强。它原生支持&lt;strong&gt;文本+图像+视频输入&lt;/strong&gt;，是个视觉语言模型（VLM）。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;场景&lt;/th&gt;
					&lt;th&gt;Benchmark&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th&gt;对比&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;科学推理&lt;/td&gt;
					&lt;td&gt;GPQA Diamond&lt;/td&gt;
					&lt;td style="text-align: center"&gt;89.2&lt;/td&gt;
					&lt;td&gt;接近Opus4.6 Max的91.3&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;指令遵循&lt;/td&gt;
					&lt;td&gt;IFBench&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;79.5&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;超过Opus4.6 Max(62.5)&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;文档理解&lt;/td&gt;
					&lt;td&gt;OmniDocBench 1.5&lt;/td&gt;
					&lt;td style="text-align: center"&gt;91.1&lt;/td&gt;
					&lt;td&gt;与Qwen3.7-Plus持平&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;视觉数学&lt;/td&gt;
					&lt;td&gt;MathVision&lt;/td&gt;
					&lt;td style="text-align: center"&gt;&lt;strong&gt;90.0&lt;/strong&gt;&lt;/td&gt;
					&lt;td&gt;超过Qwen3.7-Plus(90.3带CI)&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;指令遵循能力（IFBench 79.5）超过了Opus4.6 Max，说明模型对复杂指令的理解和执行更准确。&lt;/p&gt;
&lt;h2 id="诚实提醒5个需要注意的事"&gt;诚实提醒：5个需要注意的事
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;1. 所有数据都是厂商自测&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;目前没有任何第三方独立验证。官方benchmark的选择、评测条件、prompt设置都可能对自家模型有利。&lt;/p&gt;
&lt;p&gt;HN上903分说明社区关注度高，但不等于认可度高——评论区也有人质疑benchmark选择。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;2. 24GB显卡的现实限制&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;24GB显卡（如RTX 4090）确实能跑，但只能用4-bit量化+中等上下文长度。&lt;/p&gt;
&lt;p&gt;跑不了的：BF16/FP8全精度、262K原生上下文。需要长时间对话或大文件处理的场景，4-bit量化的精度损失是实打实的。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3. &amp;ldquo;开源权重&amp;rdquo;≠&amp;ldquo;完全开源&amp;rdquo;&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Apache 2.0许可证，权重完全开放，可以商用。但训练数据、训练代码、知识截止日期均未公开。&lt;/p&gt;
&lt;p&gt;对比真正的开源项目（如PyTorch），Qwen的&amp;quot;开源&amp;quot;只是开放了推理部分。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;4. Qwen Cloud还没上线&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;官方说&amp;quot;coming soon&amp;quot;，但目前没有托管推理服务。想用API只能自部署或等第三方（如硅基流动、Together AI等）。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;5. GGUF是第三方转换&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;官方只提供BF16和FP8权重。GGUF格式是unsloth等社区项目转换的，质量和兼容性由社区保证。&lt;/p&gt;
&lt;h2 id="竞品对比它站在什么位置"&gt;竞品对比：它站在什么位置
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;对比维度&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Qwen3.8-27B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Muse Glimmer 30B&lt;/th&gt;
					&lt;th style="text-align: center"&gt;Gemma 4&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;定位&lt;/td&gt;
					&lt;td style="text-align: center"&gt;编程+Agent多面手&lt;/td&gt;
					&lt;td style="text-align: center"&gt;端侧Agent模型&lt;/td&gt;
					&lt;td style="text-align: center"&gt;Google轻量模型&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;参数&lt;/td&gt;
					&lt;td style="text-align: center"&gt;27.8B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;29.6B&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td style="text-align: center"&gt;Apache 2.0&lt;/td&gt;
					&lt;td style="text-align: center"&gt;Apache 2.0&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;编程能力&lt;/td&gt;
					&lt;td style="text-align: center"&gt;DeepSWE 42.2&lt;/td&gt;
					&lt;td style="text-align: center"&gt;DeepSWE未测&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;桌面操控&lt;/td&gt;
					&lt;td style="text-align: center"&gt;OSWorld 84.3&lt;/td&gt;
					&lt;td style="text-align: center"&gt;OSWorld 65.9&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;浏览器操控&lt;/td&gt;
					&lt;td style="text-align: center"&gt;WebArena 64.8&lt;/td&gt;
					&lt;td style="text-align: center"&gt;未测&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;本地部署&lt;/td&gt;
					&lt;td style="text-align: center"&gt;24GB+4bit可跑&lt;/td&gt;
					&lt;td style="text-align: center"&gt;24GB+4bit可跑&lt;/td&gt;
					&lt;td style="text-align: center"&gt;待确认&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Qwen3.8在编程和Agent能力上明显领先Muse Glimmer-30B。&lt;/p&gt;
&lt;p&gt;OSWorld从65.9到84.3，WebArena从48.8到64.8，差距不小。&lt;/p&gt;
&lt;p&gt;但Muse Glimmer的优势在端侧部署优化，两者定位不完全重叠。&lt;/p&gt;
&lt;p&gt;和Claude/GPT等闭源API模型不直接竞争——一个本地跑，一个云端调用，成本结构完全不同。&lt;/p&gt;
&lt;h2 id="基本参数速查"&gt;基本参数速查
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;项目&lt;/th&gt;
					&lt;th&gt;数据&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;发布日期&lt;/td&gt;
					&lt;td&gt;2026-08-14&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;参数量&lt;/td&gt;
					&lt;td&gt;27.8B&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;架构&lt;/td&gt;
					&lt;td&gt;Dense causal VLM（文本+图像+视频）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;解码器层&lt;/td&gt;
					&lt;td&gt;64层（48层线性注意力 + 16层全注意力）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;原生上下文&lt;/td&gt;
					&lt;td&gt;262K tokens（YaRN可扩展到1M）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;推理模式&lt;/td&gt;
					&lt;td&gt;默认开启thinking，支持reasoning_effort三档控制&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;权重格式&lt;/td&gt;
					&lt;td&gt;BF16 + FP8&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;开源协议&lt;/td&gt;
					&lt;td&gt;Apache 2.0&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;支持框架&lt;/td&gt;
					&lt;td&gt;Transformers, vLLM, SGLang, TokenSpeed&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;HuggingFace&lt;/td&gt;
					&lt;td&gt;&lt;a class="link" href="https://huggingface.co/Qwen/Qwen3.8-27B" target="_blank" rel="noopener"
 &gt;Qwen/Qwen3.8-27B&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id="我的判断"&gt;我的判断
&lt;/h2&gt;&lt;p&gt;Qwen3.8-27B是27B级别目前最强的编程和Agent模型，这点没什么争议。&lt;/p&gt;
&lt;p&gt;但&amp;quot;最强&amp;quot;和&amp;quot;好用&amp;quot;之间隔着一层：benchmark是厂商自测、24GB显卡有实际限制、推理框架需要更新适配。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;建议&lt;/strong&gt;：等一两周，看社区实际测评和第三方benchmark结果。如果你正好需要一个本地编程助手，而且有24GB以上显卡，可以先试试4-bit量化版。&lt;/p&gt;
&lt;p&gt;不急的话，等Qwen Cloud上线再体验全精度版本。&lt;/p&gt;</description></item></channel></rss>