GPUFits

模型库 / Qwen3 32B

Qwen3 32B 显存需求与显卡搭配

Qwen3 32B 是稠密派的中坚:32.8B 参数全部参与每次前向、64 层、8 KV 头,Apache-2.0,原生 32K 上下文。它是 24GB 单卡的质量天花板——Q4_K_M @8K 总需求约 23.7GB,RTX 3090/4090 上属于“勉强装下”,想留余量需降到 Q3_K_M(约 20GB);32GB 的 RTX 5090 才真正宽裕,还能上 Q6_K。

速度是稠密的代价:每 token 要读全部约 20GB 权重,4090 理论约 38 tok/s,只有同门 MoE 30B-A3B 的十分之一。64 层带来的 8K KV 约 2.1GB,长上下文场景注意显存预算,必要时 KV 量化到 q8。选型逻辑很直接:要速度选 30B-A3B,要稠密模型的知识一致性与可预期行为选 32B。它也是 DeepSeek-R1 蒸馏生态(R1-Distill-Qwen-32B 等同尺寸模型)的代表档位,推理微调生态成熟。

架构规格

总参数32.8B
激活参数 32.8B
层数64
KV 头数 8
Head 维度128
原生上下文32K
开源协议apache-2.0
每 token KV 字节数(fp16)256.0 KB

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 34.9 GB 38.5 GB
Q6_K 26.9 GB 30.6 GB
Q4_K_M 20.1 GB 23.7 GB
Q3_K_M 16.4 GB 20.0 GB
Q2_K 13.0 GB 16.6 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 需 2 张 试算 →
RTX 3090 24.0 GB 勉强装下 Q4_K_M ≈35 tok/s 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 需 2 张 试算 →
RTX 4090 24.0 GB 勉强装下 Q4_K_M ≈38 tok/s 试算 →
RTX 5090 32.0 GB 宽裕 Q6_K ≈50 tok/s 试算 →
RTX A6000 48.0 GB 宽裕 Q8_0 ≈17 tok/s 试算 →
A100 80GB 80.0 GB 宽裕 FP16 ≈23 tok/s 试算 →
H100 80GB 80.0 GB 宽裕 FP16 ≈38 tok/s 试算 →
RX 7900 XTX 24.0 GB 勉强装下 Q4_K_M ≈36 tok/s 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 宽裕 Q6_K ≈8 tok/s 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 宽裕 Q8_0 ≈12 tok/s 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 宽裕 FP16 ≈9 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

24GB 显卡能跑 Qwen3 32B 吗?
勉强装下:Q4_K_M @8K 约 23.7GB,几乎顶满 24GB。建议上下文别开太大、KV 量化 q8;要宽裕就上 32GB 的 RTX 5090,或降到 Q3_K_M(约 20GB)。
Qwen3 32B 和 30B-A3B 到底差在哪?
32B 是稠密:全部 32.8B 参数参与每次计算,4090 理论约 38 tok/s;30B-A3B 是 MoE:只激活 3.3B,理论约 374 tok/s。质量互有胜负,速度差 10 倍,按你要“扎实”还是“快”选。
Qwen3 32B 的上下文是多少?
原生 32K(config 40960),官方支持 YaRN 扩展到 131K,但扩展段质量有折损。64 层 × 8 KV 头让 8K KV 约 2.1GB,长上下文请预留显存。

相关指南

在显卡兼容性查询工具中试算 Qwen3 32B →

数据核实于 2026-09-01