GPUFits

模型库 / Qwen3 30B-A3B

Qwen3 30B-A3B 显存需求与显卡搭配

Qwen3 30B-A3B 是 MoE 魔法的第一课:总参数 30.5B(128 个专家、每 token 激活 8 个),但激活参数只有 3.3B——显存按总参数装(Q4_K_M @8K 约 21GB,24GB 卡勉强装下),速度却按 3.3B 跑:RTX 4090 上理论约 374 tok/s,是同尺寸稠密模型的 4 倍以上。这就是“显存按总参数、速度按激活参数”的 MoE 铁律。

Apache-2.0 协议、原生 32K 上下文(YaRN 可到 131K)、支持思考模式。对比自家稠密的 Qwen3 32B:速度快得多、显存略省、质量在多数基准互有胜负——稠密派认为 32B 知识更扎实,MoE 派则无法拒绝 4 倍速度。CPU 卸载场景下 MoE 的优势还会进一步放大(每 token 只需从内存读 3.3B 的部分)。24GB 卡追求响应速度的通用助手,它是本站的第一推荐。

架构规格

总参数30.5B
激活参数(MoE:显存按总参数装,速度按激活参数跑) 3.3B
层数48
KV 头数 4
Head 维度128
原生上下文32K
开源协议apache-2.0
每 token KV 字节数(fp16)96.0 KB

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 32.4 GB 34.7 GB
Q6_K 25.0 GB 27.4 GB
Q4_K_M 18.7 GB 21.0 GB
Q3_K_M 15.3 GB 17.6 GB
Q2_K 12.1 GB 14.4 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 需 2 张 试算 →
RTX 3090 24.0 GB 勉强装下 Q4_K_M ≈347 tok/s 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 Q2_K ≈385 tok/s 试算 →
RTX 4090 24.0 GB 勉强装下 Q4_K_M ≈374 tok/s 试算 →
RTX 5090 32.0 GB 宽裕 Q6_K ≈496 tok/s 试算 →
RTX A6000 48.0 GB 宽裕 Q8_0 ≈164 tok/s 试算 →
A100 80GB 80.0 GB 宽裕 FP16 ≈232 tok/s 试算 →
H100 80GB 80.0 GB 宽裕 FP16 ≈381 tok/s 试算 →
RX 7900 XTX 24.0 GB 勉强装下 Q4_K_M ≈356 tok/s 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 宽裕 Q8_0 ≈58 tok/s 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 宽裕 Q8_0 ≈117 tok/s 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 宽裕 FP16 ≈93 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

Qwen3 30B-A3B 为什么这么快?
MoE 架构:128 个专家每 token 只激活 8 个,激活参数 3.3B——decode 时每 token 只需读取约 2GB 权重,RTX 4090 理论约 374 tok/s,而稠密 32B 只有约 38 tok/s。
24GB 显卡能跑 Qwen3 30B-A3B 吗?
勉强装下。Q4_K_M @8K 约 21GB,余量约 3GB;Q6_K 约 27.4GB 装不下,32GB 卡(RTX 5090)才行。
Qwen3 30B-A3B 和 Qwen3 32B 怎么选?
要速度、要 CPU 卸载友好选 30B-A3B;要稠密模型的知识一致性与可预期行为选 32B。同一张 24GB 卡上,前者“快且够用”,后者“慢但更扎实”。

相关指南

在显卡兼容性查询工具中试算 Qwen3 30B-A3B →

数据核实于 2026-09-01