每十亿参数需要多少显存?(2026 速查表)
更新于 2026-09-10 · 核实于 2026-08-04
本地大模型领域最有用的一个数字就是每十亿参数的显存占用。记住下面这张表,任何模型的显存需求你都能心算出来。
速查表(仅权重,实测值)
| 量化档位 | 每权重比特数 | 每 1B 参数占用 | 相对 FP16 |
|---|---|---|---|
| FP16 | 16.0 | 2.00 GB | — |
| Q8_0 | 8.5 | 1.06 GB | −47% |
| Q6_K | 6.6 | 0.82 GB | −59% |
| Q5_K_M | 5.7 | 0.71 GB | −64% |
| Q4_K_M | 4.9 | 0.61 GB | −69% |
| Q3_K_M | 4.0 | 0.50 GB | −75% |
| Q2_K | 3.2 | 0.40 GB | −80% |
这些不是 llama.cpp 的理论比特率,而是从真实 GGUF 文件实测得出(Llama-3.1-8B,2026-08-04 验证)。实测值略高于理论值,因为嵌入表和元数据的压缩率更低;模型越大,差距越小。
为什么显存和参数量是线性关系
模型的每个参数就是一个需要常驻显存的数字。FP16 下每个数字占 2 字节,所以 1B(十亿)参数恰好约 2GB——没有压缩、没有技巧,这是最朴素的部分。量化做的事就是把每个数字用更少的比特表示:Q4 把权重压到约 4 bit,理论上每 1B 参数只要 0.5GB。
但实测是 0.61GB,差的 20% 去哪了?三个来源:一是量化按块(block)进行,每块都要额外存缩放系数;二是 K 系量化会把嵌入表、输出头等敏感张量保留在更高精度(Q6 甚至 Q8);三是 GGUF 文件里的元数据。所以不要拿「bit ÷ 8」当精确值,小模型上尤其不准——8B 模型的嵌入表占比远高于 70B 模型。
完整公式
总显存 = 权重(上表 × 参数量)+ KV 缓存 + 运行时开销
- KV 缓存:常见模型在 8K 上下文下约 0.5–4GB,随上下文长度线性增长。Qwen3-32B 从 8K 的 2.1GB 涨到 32K 的 8.6GB。
- 运行时开销:约 1.5GB(CUDA 上下文等)。
KV 缓存为什么不在这张表里
因为 KV 缓存和参数量无关,它取决于架构常数:层数 × KV 头数 × 头维度 × 上下文长度。这导致一个反直觉的现象——27B 的 Gemma-3(62 层、16 个 KV 头)在 8K 上下文下 KV 缓存约 4.2GB,比 70B 的 Llama-3.3(80 层但只有 8 个 KV 头)的 2.7GB 还大。模型越大,KV 缓存占比反而可能越小。
这也是为什么「每 1B 参数多少显存」只适用于权重部分。KV 缓存需要按模型单独算,公式和逐模型数据见我们的 KV 缓存详解。
完整算例(Q4_K_M,8K 上下文)
| 模型 | 权重 | KV 缓存 | 开销 | 合计 | 判定 |
|---|---|---|---|---|---|
| Llama 3.2 3B | 2.0 GB | 0.9 GB | 1.5 GB | 4.4 GB | 8GB 显卡即可 |
| Llama 3.1 8B | 4.9 GB | 1.1 GB | 1.5 GB | 7.5 GB | 12GB 显卡轻松 |
| Mistral Small 24B | 14.7 GB | 1.3 GB | 1.5 GB | 17.5 GB | 24GB 舒适,16GB 需降 Q3 |
| Qwen3 32B | 20.1 GB | 2.1 GB | 1.5 GB | 23.7 GB | 24GB 显卡勉强 |
| Llama 3.3 70B | 43.2 GB | 2.7 GB | 1.5 GB | 47.4 GB | 需要 2×24GB 或 48GB 卡 |
| gpt-oss-120b(MoE) | 71.5 GB | 0.6 GB¹ | 1.5 GB | 73.6 GB | 96GB Mac 或 4×24GB |
| DeepSeek-R1 671B | 411.0 GB | 0.6 GB¹ | 1.5 GB | 413.1 GB | 只能用云端 |
¹ DeepSeek-R1 使用 MLA 注意力机制、gpt-oss-120b 使用 GQA 加滑窗注意力,KV 缓存都被大幅压缩,详见我们的 KV 缓存指南。
按显卡档位对号入座
把上表反过来看,就是每张卡能跑什么。判定口径:需求 ≤ 显存 × 80% 为「舒适」,≤ 100% 为「勉强」。
- 12GB(RTX 3060):8B Q4 舒适(7.5GB);甚至可以上 8B Q8(约 11.1GB,勉强)。16B 以上建议直接降档或换卡。
- 16GB(RTX 4070 Ti Super):8B Q8 舒适;Mistral 24B 这类 24B 模型 Q4 装不下(17.5GB),降到 Q3_K_M 后约 14.8GB,勉强可行。
- 24GB(RTX 3090/4090):24B Q4 舒适;Qwen3-32B Q4 勉强(23.7GB);Gemma-3-27B Q4 在 8K 下勉强(22.4GB),但上下文拉到 32K 时 KV 缓存膨胀到 16.6GB,合计约 35GB,直接出局。
- 32GB(RTX 5090):Qwen3-32B Q4 可以带满 32K 上下文(约 30.2GB,勉强)。70B 即使降到 Q2 也要约 32.2GB,仍然装不下。
- 48GB(RTX A6000 / 2×24GB):70B Q4 的入场券,47.4GB 刚好「勉强」。
- Apple 统一内存:可用显存按标称 × 0.75 折算。Mac mini M4 Pro 48GB 实际可用约 36GB,跑 Qwen3-32B Q4 很舒适;96GB 的 Mac Studio(可用约 72GB)是 gpt-oss-120b 的最低门槛,刚好踩线。
显存决定能不能跑,带宽决定跑多快
装下只是第一步。生成速度的理论上限 ≈ 显存带宽 × 0.75 ÷ 每 token 需读取的权重大小(理论估算,实际受框架/驱动影响,误差 ±30%)。几个对照:
- 8B Q4:RTX 3060(360 GB/s)约 55 tok/s,RTX 4090(1008 GB/s)约 154 tok/s,Mac mini M4 Pro(273 GB/s)约 42 tok/s。
- Qwen3-32B Q4 在 Mac mini M4 Pro 上显存很宽裕,但只有约 10 tok/s——能跑和好用是两回事。
- MoE 模型每 token 只读激活参数:Qwen3-30B-A3B 在 RTX 4090 上理论约 370 tok/s,和一个 3B 稠密模型相当,代价是 21GB 显存。
最惨的情况是装不下硬跑:CPU 卸载会把等效带宽压到系统内存的 60–100 GB/s。70B Q4 从双 4090 的约 30 tok/s 直接掉到约 1.4 tok/s,慢 20 倍。显存差 1GB 时宁可降一档量化,也不要靠卸载补上。
实操:五步算出任何模型的显存需求
- 查参数量:Hugging Face 模型页或文件名里都写着(7B、32B、A3B 等)。MoE 注意区分总参数和激活参数。
- 算权重:参数量 × 速查表中的每 1B 占用。想精确到具体档位,用本站显存计算器,数字口径与本文完全一致。
- 算 KV 缓存:按 8K 上下文,8B 级加约 1GB、30B 级加约 2GB、70B 级加约 3GB 粗估;要长上下文就按比例放大。不知道架构常数时,这个粗估足够做购卡决策。
- 加 1.5GB 运行时开销。
- 对比可用显存:独显直接用标称值,Apple 统一内存 × 0.75。需求 ≤ 可用 × 80% 算舒适,超过 100% 就别硬上。
装不下时的取舍顺序:降一档量化 > 缩短上下文 > 开 q8 KV 缓存 > 加卡 > CPU 卸载。我们的推荐逻辑也按这个来——勉强的 Q4 永远优于宽裕的 Q2,质量损失比显存余量更影响体验。
什么时候用哪一档
- Q8_0 / Q6_K:显存宽裕且任务对质量敏感(代码、数学、长文写作)。12GB 跑 8B、24GB 跑 13B 时值得上 Q8。
- Q4_K_M:默认答案。日常对话、总结、翻译,质量损失几乎不可察觉,显存省 70%。
- Q3_K_M:边界救场——16GB 想跑 24B、24GB 想跑 32B 长上下文时的现实选择,质量开始可感知但可用。
- Q2_K:仅用于「我就想知道 70B 说话什么味儿」的尝鲜场景。质量损失明显,不要用于正经工作。
常见误区
「GGUF 文件 5GB,所以 8GB 显卡够了。」 文件体积 ≈ 权重,加载后还要加 KV 缓存和约 1.5GB 运行时开销。5GB 的文件实际需要约 7.5GB。
「MoE 只需加载激活参数。」 错。每个 token 生成时才决定走哪些专家,所以全部专家必须常驻显存。激活参数只影响速度,不影响容量。
「模型标称支持 128K 上下文,我的卡就能用 128K。」 KV 缓存随上下文线性增长,Qwen3-32B 的 KV 从 8K 的 2.1GB 涨到 128K 的 34GB——比权重还大。标称上下文是架构能力,不是你的显存预算。
「每张 24GB 卡就是 24GB 可用。」 多卡拼接时显存可以直接相加,但 macOS/Windows 桌面、浏览器都会占显存;Apple 统一内存更是要按 0.75 折算。留 20% 余量是经验底线。
心算口诀
经验法则:Q4_K_M 下 GB ≈ 0.6 × 参数十亿数。 8B → 约 5GB,30B → 约 18GB,70B → 约 43GB。8K 上下文再加约 2.5GB 的 KV 缓存与开销,上下文更长则再加。
MoE 模型(DeepSeek-R1、gpt-oss、Qwen3-A3B)仍需把全部参数装入显存,但生成速度取决于小得多的激活参数量。这就是为什么 gpt-oss-120b 需要 74GB 显存却跑得挺快。
常见问题
7B 或 8B 模型需要多少显存?
Q4_K_M 下权重约 4.9GB,8K 上下文的 KV 缓存约 1.1GB,再加约 1.5GB 运行时开销,合计约 7.5GB。任何 12GB 显卡都能轻松运行,甚至可以上 Q8(约 11.1GB,刚好装下)。
70B 模型需要多少显存?
Q4_K_M 下含 KV 缓存与开销合计约 47GB,单张消费级显卡放不下。两张 24GB 显卡(48GB)或一张 48GB 的 RTX A6000 可以勉强运行,64GB 以上才算宽裕。
为什么速查表以 Q4_K_M 为默认档?
Q4_K_M 是社区标准:相比 FP16 省约 70% 显存,而在对话场景中大多数用户察觉不到质量损失。所有主流运行时(llama.cpp、Ollama、LM Studio)都把它作为默认下载档。
GGUF 文件只有 5GB,为什么加载后占了 7.5GB 显存?
文件体积约等于权重本身。KV 缓存和运行时开销(CUDA 上下文、计算缓冲区)是模型加载后才在显存里分配的,不体现在文件大小里。估算显存时永远要在文件大小之上再加 2.5GB 左右。
MoE 模型是不是只需把激活参数装进显存?
不是。所有专家都必须常驻显存,因为生成每个 token 时才会决定激活哪些专家。激活参数量只决定速度快慢,不决定显存占用——gpt-oss-120b 需要约 74GB 显存,但生成速度按 5.1B 激活参数算。