先说结论:4090 跑不了 GLM-5.2,Qwen3-30B-A3B 才是你的甜区。
GLM-5.2 是 744B 参数的 MoE 模型,哪怕 2-bit 量化也要 238GB 显存,4090 的 24GB 连零头都不够。别折腾了,老老实实调 API。
但 4090 并不是废物。2026 年国产大模型格局变了,MoE 架构让小显存也能跑大模型。一张 4090,能跑的东西比你想的多。
4090 的 24GB 显存,2026 年能跑什么?
2026 年国产大模型三足鼎立:DeepSeek V4、GLM-5.2、Qwen3。
但「能发布」和「能本地跑」是两回事。4090 的 24GB 显存有硬天花板:
| 量化方案 | 显存需求上限 | 能跑的最大模型 |
|---|---|---|
| FP16 | 24GB | ~12B |
| INT8 | 24GB | ~24B |
| INT4/Q4_K_M | 24GB | ~32B |
| 2-bit | 24GB | ~48B(质量严重下降) |
关键点:MoE 模型虽然只激活部分参数,但推理时需要加载全部权重到显存。30B 总参 / 3B 激活的 MoE,显存需求按 30B 算,不是 3B。
所以 4090 的实际天花板是:32B INT4 或 30B MoE Q4_K_M。
GLM-5.2 — 744B 的"看得到吃不到"
GLM-5.2 是智谱 2026 年的旗舰模型:
| 参数 | 值 |
|---|---|
| 总参数 | 744B |
| 激活参数 | ~40B(MoE) |
| 架构 | MoE,256 个专家(每个 token 激活 8+1 个) |
| 2-bit 量化显存 | 238GB |
| 4-bit 量化显存 | ~372GB |
即使是最激进的 2-bit 量化(质量已经很差),也需要 238GB 显存。4090 的 24GB 只有它的十分之一。
这个模型适合什么硬件?
- Mac Studio 256GB 统一内存:勉强能跑 2-bit,速度慢但可用
- 多卡服务器:4×A100 80GB 或 8×4090,用张量并行
- 云 GPU:按小时租 A100/H100,适合偶尔用
4090 用户想用 GLM 系列,替代方案是:
| 模型 | 参数 | 显存(FP16) | 可用性 |
|---|---|---|---|
| GLM-4-9B | 9B | ~18GB | ✅ 4090 轻松跑 |
| GLM-Z1-9B | 9B(推理增强) | ~18GB | ✅ 4090 轻松跑 |
| GLM-5.2 API | 744B | 无 | ✅ 按 token 付费 |
说实话,GLM-4-9B 和 GLM-Z1-9B 的能力跟 GLM-5.2 差了一个量级。如果你需要 GLM-5.2 级别的能力,调 API 是唯一现实选择。
Qwen3-30B-A3B — 4090 的真正甜区
Qwen3 系列里,最适合 4090 的不是 Qwen3-32B,而是 Qwen3-30B-A3B。
为什么?MoE 架构。
| 对比项 | Qwen3-30B-A3B | Qwen3-32B |
|---|---|---|
| 总参数 | 30B | 32B |
| 激活参数 | 3B | 32B(全量) |
| 架构 | MoE | Dense |
| Q4_K_M 显存 | ~18GB | ~20GB |
| 推理速度(4090) | ~45 tok/s | ~18 tok/s |
| 综合能力 | 接近 | 略强 |
Qwen3-30B-A3B 的核心优势:
- 显存友好:Q4_K_M 量化后只需 ~18GB,4090 还剩 6GB 给 KV Cache
- 速度快:只激活 3B 参数做推理,速度是 Dense 32B 的 2-3 倍
- 能力不差:MoE 的 30B 总参保证了知识容量,3B 激活保证了速度
实际推理速度(4090 + Ollama Q4_K_M):
| 模型 | 输出速度 | 首 token 延迟 |
|---|---|---|
| Qwen3-30B-A3B | ~45 tok/s | ~0.3s |
| Qwen3-32B | ~18 tok/s | ~0.8s |
| Qwen3-14B | ~35 tok/s | ~0.4s |
| Qwen3-8B | ~65 tok/s | ~0.2s |
30B-A3B 的速度接近 14B,但能力接近 32B。这就是 MoE 的魔力。
4090 能跑的国产模型清单
以下是 2026 年 4090(24GB)实测可用的国产大模型:
| 模型 | 参数 | 量化方案 | 显存需求 | 推荐场景 |
|---|---|---|---|---|
| Qwen3-30B-A3B | 30B/3B激活 | Q4_K_M | ~18GB | ⭐ 日常对话+编程 |
| Qwen3-32B | 32B | Q4_K_M | ~20GB | 需要最高质量 |
| Qwen3-14B | 14B | INT8 | ~15GB | 需INT8,平衡之选 |
| Qwen3-8B | 8B | FP16 | ~16GB | 轻量级,速度最快 |
| DeepSeek-R1-32B(蒸馏) | 32B | INT4 | ~20GB | 推理/数学任务 |
| GLM-4-9B | 9B | FP16 | ~18GB | GLM 生态兼容 |
| GLM-Z1-9B | 9B | FP16 | ~18GB | 推理增强 |
场景推荐:
- 日常对话:Qwen3-30B-A3B(速度快、质量好)
- 编程辅助:Qwen3-30B-A3B 或 Qwen3-32B(代码能力 32B 更强)
- 数学/推理:DeepSeek-R1-32B 蒸馏版(推理任务专项优化)
- Agent/工具调用:Qwen3-30B-A3B(速度快,适合多轮工具调用)
- GLM 生态:GLM-Z1-9B(但能力有限,复杂任务建议 API)
框架选择 — Ollama vs vLLM vs SGLang
选完模型,还要选推理框架。三个主流选择:
| 框架 | 优势 | 劣势 | 适用场景 |
|---|---|---|---|
| Ollama | 5分钟上手,一键安装 | 并发性能一般 | 个人使用、开发调试 |
| vLLM | 高并发吞吐 | 配置复杂 | 服务化部署、多人共用 |
| SGLang | Agent/工具调用优化 | 生态较小 | AI Agent 开发 |
Ollama(推荐大多数人):
| |
5 分钟搞定,适合个人开发者。Ollama 会自动根据你的显存选择量化方案,不需要手动配置。
vLLM(需要高并发时):
| |
如果你要给团队用,或者需要同时处理多个请求,vLLM 的 PagedAttention 能把吞吐量提升 3-5 倍。
SGLang(Agent 开发专用):
| |
SGLang 对工具调用和结构化输出有专门优化,如果你在做 AI Agent 开发,值得试试。
结论:消费级显卡本地部署的理性预期
一张 4090 能跑的国产大模型,比 2025 年多了不少,但别指望能跑旗舰。
值得本地跑的场景:
- 日常对话、写作辅助(Qwen3-30B-A3B 足够)
- 编程辅助(30B-A3B 或 32B,取决于代码复杂度)
- 隐私敏感任务(不能把数据发到云端)
- 高频调用(API 按 token 计费,高频场景本地更划算)
- 学习和实验(理解模型推理过程)
用 API 更划算的场景:
- 需要最强模型能力(GLM-5.2、DeepSeek V4 旗舰版)
- 低频使用(偶尔用一次,不值得买显卡)
- 多模态任务(图像、语音理解,本地模型支持有限)
- 长上下文(本地模型上下文窗口通常 8K-32K,API 可以 128K+)
2026 年的现实是:MoE 架构让消费级显卡也能跑「够用」的大模型,但「最强」的大模型仍然需要专业硬件或 API。4090 + Qwen3-30B-A3B 是目前性价比最高的组合,别被 GLM-5.2 的参数量迷了眼。
作者:varkm