模型库 / Qwen3 32B
Qwen3 32B 显存需求与显卡搭配
Qwen3 32B 是稠密派的中坚:32.8B 参数全部参与每次前向、64 层、8 KV 头,Apache-2.0,原生 32K 上下文。它是 24GB 单卡的质量天花板——Q4_K_M @8K 总需求约 23.7GB,RTX 3090/4090 上属于“勉强装下”,想留余量需降到 Q3_K_M(约 20GB);32GB 的 RTX 5090 才真正宽裕,还能上 Q6_K。
速度是稠密的代价:每 token 要读全部约 20GB 权重,4090 理论约 38 tok/s,只有同门 MoE 30B-A3B 的十分之一。64 层带来的 8K KV 约 2.1GB,长上下文场景注意显存预算,必要时 KV 量化到 q8。选型逻辑很直接:要速度选 30B-A3B,要稠密模型的知识一致性与可预期行为选 32B。它也是 DeepSeek-R1 蒸馏生态(R1-Distill-Qwen-32B 等同尺寸模型)的代表档位,推理微调生态成熟。
架构规格
| 总参数 | 32.8B |
| 激活参数 | 32.8B |
| 层数 | 64 |
| KV 头数 | 8 |
| Head 维度 | 128 |
| 原生上下文 | 32K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 256.0 KB |
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 34.9 GB | 38.5 GB |
| Q6_K | 26.9 GB | 30.6 GB |
| Q4_K_M | 20.1 GB | 23.7 GB |
| Q3_K_M | 16.4 GB | 20.0 GB |
| Q2_K | 13.0 GB | 16.6 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| RTX 3090 | 24.0 GB | 勉强装下 | Q4_K_M | ≈35 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| RTX 4090 | 24.0 GB | 勉强装下 | Q4_K_M | ≈38 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | Q6_K | ≈50 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | Q8_0 | ≈17 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈23 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈38 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 勉强装下 | Q4_K_M | ≈36 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | Q6_K | ≈8 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | Q8_0 | ≈12 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈9 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 24GB 显卡能跑 Qwen3 32B 吗?
- 勉强装下:Q4_K_M @8K 约 23.7GB,几乎顶满 24GB。建议上下文别开太大、KV 量化 q8;要宽裕就上 32GB 的 RTX 5090,或降到 Q3_K_M(约 20GB)。
- Qwen3 32B 和 30B-A3B 到底差在哪?
- 32B 是稠密:全部 32.8B 参数参与每次计算,4090 理论约 38 tok/s;30B-A3B 是 MoE:只激活 3.3B,理论约 374 tok/s。质量互有胜负,速度差 10 倍,按你要“扎实”还是“快”选。
- Qwen3 32B 的上下文是多少?
- 原生 32K(config 40960),官方支持 YaRN 扩展到 131K,但扩展段质量有折损。64 层 × 8 KV 头让 8K KV 约 2.1GB,长上下文请预留显存。
相关指南
数据核实于 2026-09-01