模型库:显存需求与显卡搭配
每个模型的详情页包含架构规格、五档量化显存实算、12 张显卡的判定矩阵(宽裕/勉强/多卡/不可行)与理论速度估算。所有数字按本站公式实算:权重 = 参数 × bpw ÷ 8,KV 缓存按 8K 上下文 fp16,另加 1.5GB 运行时开销。
| 模型 | 参数量 | 架构 | Q4_K_M @8K 显存 |
|---|---|---|---|
| Llama 3.2 3B | 3.21B | 稠密 | 4.4 GB |
| Llama 3.1 8B | 8.03B | 稠密 | 7.5 GB |
| Qwen3 8B | 8.2B | 稠密 | 7.7 GB |
| Phi-4 14B | 14.7B | 稠密 | 12.2 GB |
| gpt-oss-20b | 20.9B / 3.6B | MoE | 14.7 GB |
| Mistral Small 3.2 24B | 24B | 稠密 | 17.5 GB |
| Gemma 3 27B | 27.4B | 稠密 | 22.4 GB |
| Qwen3.8 27B | 27.8B | 稠密 | 20.7 GB |
| Muse Glimmer 30B | 29.6B | 稠密 | 20.1 GB |
| Qwen3 30B-A3B | 30.5B / 3.3B | MoE | 21.0 GB |
| Qwen3 32B | 32.8B | 稠密 | 23.7 GB |
| Llama 3.3 70B | 70.6B | 稠密 | 47.4 GB |
| gpt-oss-120b | 116.8B / 5.1B | MoE | 73.6 GB |
| DeepSeek-R1 671B | 671B / 37B | MoE · MLA | 413.1 GB |
数据核实于 2026-09-01