模型库 / Qwen3 30B-A3B
Qwen3 30B-A3B 显存需求与显卡搭配
Qwen3 30B-A3B 是 MoE 魔法的第一课:总参数 30.5B(128 个专家、每 token 激活 8 个),但激活参数只有 3.3B——显存按总参数装(Q4_K_M @8K 约 21GB,24GB 卡勉强装下),速度却按 3.3B 跑:RTX 4090 上理论约 374 tok/s,是同尺寸稠密模型的 4 倍以上。这就是“显存按总参数、速度按激活参数”的 MoE 铁律。
Apache-2.0 协议、原生 32K 上下文(YaRN 可到 131K)、支持思考模式。对比自家稠密的 Qwen3 32B:速度快得多、显存略省、质量在多数基准互有胜负——稠密派认为 32B 知识更扎实,MoE 派则无法拒绝 4 倍速度。CPU 卸载场景下 MoE 的优势还会进一步放大(每 token 只需从内存读 3.3B 的部分)。24GB 卡追求响应速度的通用助手,它是本站的第一推荐。
架构规格
| 总参数 | 30.5B |
| 激活参数(MoE:显存按总参数装,速度按激活参数跑) | 3.3B |
| 层数 | 48 |
| KV 头数 | 4 |
| Head 维度 | 128 |
| 原生上下文 | 32K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 96.0 KB |
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 32.4 GB | 34.7 GB |
| Q6_K | 25.0 GB | 27.4 GB |
| Q4_K_M | 18.7 GB | 21.0 GB |
| Q3_K_M | 15.3 GB | 17.6 GB |
| Q2_K | 12.1 GB | 14.4 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| RTX 3090 | 24.0 GB | 勉强装下 | Q4_K_M | ≈347 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | Q2_K | ≈385 tok/s | 试算 → |
| RTX 4090 | 24.0 GB | 勉强装下 | Q4_K_M | ≈374 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | Q6_K | ≈496 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | Q8_0 | ≈164 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈232 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈381 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 勉强装下 | Q4_K_M | ≈356 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | Q8_0 | ≈58 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | Q8_0 | ≈117 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈93 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- Qwen3 30B-A3B 为什么这么快?
- MoE 架构:128 个专家每 token 只激活 8 个,激活参数 3.3B——decode 时每 token 只需读取约 2GB 权重,RTX 4090 理论约 374 tok/s,而稠密 32B 只有约 38 tok/s。
- 24GB 显卡能跑 Qwen3 30B-A3B 吗?
- 勉强装下。Q4_K_M @8K 约 21GB,余量约 3GB;Q6_K 约 27.4GB 装不下,32GB 卡(RTX 5090)才行。
- Qwen3 30B-A3B 和 Qwen3 32B 怎么选?
- 要速度、要 CPU 卸载友好选 30B-A3B;要稠密模型的知识一致性与可预期行为选 32B。同一张 24GB 卡上,前者“快且够用”,后者“慢但更扎实”。
相关指南
数据核实于 2026-09-01