GPUFits

模型库:显存需求与显卡搭配

每个模型的详情页包含架构规格、五档量化显存实算、12 张显卡的判定矩阵(宽裕/勉强/多卡/不可行)与理论速度估算。所有数字按本站公式实算:权重 = 参数 × bpw ÷ 8,KV 缓存按 8K 上下文 fp16,另加 1.5GB 运行时开销。

模型 参数量 架构 Q4_K_M @8K 显存
Llama 3.2 3B 3.21B 稠密 4.4 GB
Llama 3.1 8B 8.03B 稠密 7.5 GB
Qwen3 8B 8.2B 稠密 7.7 GB
Phi-4 14B 14.7B 稠密 12.2 GB
gpt-oss-20b 20.9B / 3.6B MoE 14.7 GB
Mistral Small 3.2 24B 24B 稠密 17.5 GB
Gemma 3 27B 27.4B 稠密 22.4 GB
Qwen3.8 27B 27.8B 稠密 20.7 GB
Muse Glimmer 30B 29.6B 稠密 20.1 GB
Qwen3 30B-A3B 30.5B / 3.3B MoE 21.0 GB
Qwen3 32B 32.8B 稠密 23.7 GB
Llama 3.3 70B 70.6B 稠密 47.4 GB
gpt-oss-120b 116.8B / 5.1B MoE 73.6 GB
DeepSeek-R1 671B 671B / 37B MoE · MLA 413.1 GB

数据核实于 2026-09-01