Qwen 是目前本地部署生态最完善的国产大模型。不管是 8GB 内存核显笔记本、4090 工作站,还是无显卡老机器,都有对应型号和量化方案。本文不说空话,直接按显卡预算给推荐。
我测试了 Qwen3.5 全系列 + Ollama/vLLM 三种部署方式,对比了内存占用、首 token 延迟、生成速度,帮你找到最值的那款。
Qwen 模型家族全图景
Qwen 在 2026 年形成完整矩阵:
| 模型 | 参数量 | 激活参数 | 显存需求(Q4) | 适用场景 |
|---|---|---|---|---|
| Qwen3.5 | 397B MoE (A17B) | 17B | ~200GB+ | 企业级、对标 GPT-4o |
| Qwen3-Coder | 480B-A35B | 35B | ~240GB+ | 编程专用、多卡服务器部署 |
| Qwen3.6-35B-A3B | 35B-A3B MoE | 3B | ~18GB | 性价比甜点、推理快 |
| Qwen3.5-9B | 9B Dense | 9B | 5.5GB | 消费级显卡推荐起点 |
| Qwen3.5-4B | 4B Dense | 4B | ~2.5GB | 核显笔记本可跑 |
| Qwen3.5-2B | 2B Dense | 2B | ~1.2GB | 老旧机器过渡 |
| Qwen3.5-0.8B | 0.8B Dense | 0.8B | ~0.5GB | 无显卡纯 CPU |
核心差异:MoE(专家混合)vs Dense。MoE 模型(Qwen3.5、Qwen3-Coder)只激活部分参数,推理时等效于小模型,但需要更大的总显存来加载完整权重。Dense 模型(Qwen3.5-9B)所有参数都参与计算,显存占用低但推理慢。
三种部署方式对比
| 工具 | 安装难度 | 性能 | 适用平台 | 适合人群 |
|---|---|---|---|---|
| Ollama | 一行命令 | 中等 | Linux/Mac/Windows | 入门用户、日常使用 |
| vLLM | pip 安装 | 高(多卡并行) | Linux + GPU | API 服务、生产环境 |
| LM Studio/MLX | GUI | 中等 | macOS | Mac 用户首选 |
结论:入门用 Ollama,生产用 vLLM。下文覆盖两者完整实战。
实战一:Ollama 一键部署 Qwen3.5-9B
Ollama 是最简单的本地部署方式。以 Qwen3.5-9B 为例:
| |
默认 Q4_K_M 量化,8GB RAM 可流畅运行。实测在 16GB RAM + RTX 3060(12GB)上:首 token 延迟约 0.8s,生成速度约 28 tok/s。
Modelfile 自定义:调整上下文长度、温度:
| |
保存为 Modelfile,运行 ollama create custom-qwen -f Modelfile && ollama run custom-qwen。
实战二:vLLM 部署 Qwen3.6-35B-A3B
Qwen3.6-35B-A3B 是性价比甜点:MoE 架构只激活 3B 参数,推理速度堪比 7B 模型,但需要约 18GB 显存加载完整权重。
| |
为什么用 AWQ 量化:相比 GPTQ,AWQ 在 MoE 模型上的精度损失更小,且推理速度更快。
实测在 RTX 4090(24GB)上:首 token 延迟约 0.4s,生成速度约 45 tok/s,相比 Ollama 有明显提升。
OpenAI 兼容调用:
| |
按显卡预算推荐配置
| 显卡 | 推荐模型 | 量化级别 | 预期性能 |
|---|---|---|---|
| 无显卡(8GB RAM) | Qwen3.5-2B | Q4 | 首 token 约 2s,约 15 tok/s |
| 核显(16GB RAM) | Qwen3.5-4B | Q4 | 首 token 约 1.5s,约 20 tok/s |
| RTX 3060 12GB | Qwen3.5-9B | Q4_K_M | 首 token 约 0.8s,约 28 tok/s |
| RTX 4070 Ti 16GB | Qwen3.5-9B | Q8_0 | 首 token 约 0.6s,约 35 tok/s |
| RTX 4090 24GB | Qwen3.6-35B-A3B | AWQ | 首 token 约 0.4s,约 45 tok/s |
| 多卡服务器(240GB+) | Qwen3-Coder 480B | AWQ | 首 token 约 0.3s,约 60 tok/s |
无显卡方案:Ollama 会自动降级到 CPU 推理,速度慢但可用。临时测试跑大模型可上云 GPU(RunPod/Lambda Labs),按小时计费约 $0.5-1/h。
进阶:用 Qwen3-Coder 做 Vibe Coding
本地 Qwen3-Coder + Claude Code CLI 或 OpenCode,可实现完整的 Vibe Coding 工作流:
| |
对比 DeepSeek:Qwen3-Coder 在编程任务上表现强劲,本地部署生态更完善。DeepSeek 最新开源 V3/R1 系列,在标准 NVIDIA GPU 上即可运行,但模型体积较大,本地部署门槛较高。
踩坑指南:常见问题和解决方案
问题 1:显存不足 OOM
vLLM 启动时如果报 CUDA out of memory,尝试:
| |
问题 2:中文输出质量差
Ollama 默认英文 prompt 优先,在 Modelfile 中强制中文:
| |
问题 3:量化精度损失
Qwen3.5-9B Q4_K_M 在中文理解上基本无损,但复杂逻辑推理可能出错。对精度要求高的任务(数学证明、代码审查),推荐 Q8_0 或 FP16。
结论:一张决策表搞定
| |
核心原则:先确定显卡预算,再选对应模型和量化级别。MoE 模型适合显卡充足的用户(推理快),Dense 模型适合预算有限的用户(显存占用低)。