每十亿参数需要多少显存?(2026 速查表)
更新于 2026-08-04 · 核实于 2026-08-04
本地大模型领域最有用的一个数字就是每十亿参数的显存占用。记住下面这张表,任何模型的显存需求你都能心算出来。
速查表(仅权重,实测值)
| 量化档位 | 每权重比特数 | 每 1B 参数占用 | 相对 FP16 |
|---|---|---|---|
| FP16 | 16.0 | 2.00 GB | — |
| Q8_0 | 8.5 | 1.06 GB | −47% |
| Q6_K | 6.6 | 0.82 GB | −59% |
| Q5_K_M | 5.7 | 0.71 GB | −64% |
| Q4_K_M | 4.9 | 0.61 GB | −69% |
| Q3_K_M | 4.0 | 0.50 GB | −75% |
| Q2_K | 3.2 | 0.40 GB | −80% |
这些不是 llama.cpp 的理论比特率,而是从真实 GGUF 文件实测得出(Llama-3.1-8B,2026-08-04 验证)。实测值略高于理论值,因为嵌入表和元数据的压缩率更低;模型越大,差距越小。
完整公式
总显存 = 权重(上表 × 参数量)+ KV 缓存 + 运行时开销
- KV 缓存:常见模型在 8K 上下文下约 0.5–4GB,随上下文长度线性增长。Qwen3-32B 从 8K 的 2.1GB 涨到 32K 的 8.6GB。
- 运行时开销:约 1.5GB(CUDA 上下文等)。
完整算例(Q4_K_M,8K 上下文)
| 模型 | 权重 | KV 缓存 | 开销 | 合计 | 判定 |
|---|---|---|---|---|---|
| Llama 3.1 8B | 4.9 GB | 1.1 GB | 1.5 GB | 7.5 GB | 12GB 显卡轻松 |
| Qwen3 32B | 20.1 GB | 2.1 GB | 1.5 GB | 23.7 GB | 24GB 显卡勉强 |
| Llama 3.3 70B | 43.2 GB | 2.7 GB | 1.5 GB | 47.4 GB | 需要 2×24GB |
| gpt-oss-120b(MoE) | 71.5 GB | 1.2 GB | 1.5 GB | 74.2 GB | 96GB Mac 或 4×24GB |
| DeepSeek-R1 671B | 410.7 GB | 0.6 GB¹ | 1.5 GB | 412.8 GB | 只能用云端 |
¹ DeepSeek-R1 使用 MLA 注意力机制,KV 缓存被大幅压缩,详见我们的 KV 缓存指南。
心算口诀
经验法则:Q4_K_M 下 GB ≈ 0.6 × 参数十亿数。 8B → 约 5GB,30B → 约 18GB,70B → 约 43GB。8K 上下文再加约 2.5GB 的 KV 缓存与开销,上下文更长则再加。
MoE 模型(DeepSeek-R1、gpt-oss、Qwen3-A3B)仍需把全部参数装入显存,但生成速度取决于小得多的激活参数量。这就是为什么 gpt-oss-120b 需要 74GB 显存却跑得挺快。
常见问题
7B 或 8B 模型需要多少显存?
Q4_K_M 下权重约 4.9GB,8K 上下文的 KV 缓存约 1.1GB,再加约 1.5GB 运行时开销,合计约 7.5GB。任何 12GB 显卡都能轻松运行。
70B 模型需要多少显存?
Q4_K_M 下含 KV 缓存与开销合计约 43GB,单张消费级显卡放不下。两张 24GB 显卡(48GB)可以勉强运行,64GB 以上才算宽裕。
为什么速查表以 Q4_K_M 为默认档?
Q4_K_M 是社区标准:相比 FP16 省约 70% 显存,而在对话场景中大多数用户察觉不到质量损失。所有主流运行时(llama.cpp、Ollama、LM Studio)都把它作为默认下载档。