GPUFits

每十亿参数需要多少显存?(2026 速查表)

更新于 2026-09-10 · 核实于 2026-08-04

本地大模型领域最有用的一个数字就是每十亿参数的显存占用。记住下面这张表,任何模型的显存需求你都能心算出来。

速查表(仅权重,实测值)

量化档位每权重比特数每 1B 参数占用相对 FP16
FP1616.02.00 GB
Q8_08.51.06 GB−47%
Q6_K6.60.82 GB−59%
Q5_K_M5.70.71 GB−64%
Q4_K_M4.90.61 GB−69%
Q3_K_M4.00.50 GB−75%
Q2_K3.20.40 GB−80%

这些不是 llama.cpp 的理论比特率,而是从真实 GGUF 文件实测得出(Llama-3.1-8B,2026-08-04 验证)。实测值略高于理论值,因为嵌入表和元数据的压缩率更低;模型越大,差距越小。

为什么显存和参数量是线性关系

模型的每个参数就是一个需要常驻显存的数字。FP16 下每个数字占 2 字节,所以 1B(十亿)参数恰好约 2GB——没有压缩、没有技巧,这是最朴素的部分。量化做的事就是把每个数字用更少的比特表示:Q4 把权重压到约 4 bit,理论上每 1B 参数只要 0.5GB。

但实测是 0.61GB,差的 20% 去哪了?三个来源:一是量化按块(block)进行,每块都要额外存缩放系数;二是 K 系量化会把嵌入表、输出头等敏感张量保留在更高精度(Q6 甚至 Q8);三是 GGUF 文件里的元数据。所以不要拿「bit ÷ 8」当精确值,小模型上尤其不准——8B 模型的嵌入表占比远高于 70B 模型。

完整公式

总显存 = 权重(上表 × 参数量)+ KV 缓存 + 运行时开销

  • KV 缓存:常见模型在 8K 上下文下约 0.5–4GB,随上下文长度线性增长。Qwen3-32B 从 8K 的 2.1GB 涨到 32K 的 8.6GB。
  • 运行时开销:约 1.5GB(CUDA 上下文等)。

KV 缓存为什么不在这张表里

因为 KV 缓存和参数量无关,它取决于架构常数:层数 × KV 头数 × 头维度 × 上下文长度。这导致一个反直觉的现象——27B 的 Gemma-3(62 层、16 个 KV 头)在 8K 上下文下 KV 缓存约 4.2GB,比 70B 的 Llama-3.3(80 层但只有 8 个 KV 头)的 2.7GB 还大。模型越大,KV 缓存占比反而可能越小。

这也是为什么「每 1B 参数多少显存」只适用于权重部分。KV 缓存需要按模型单独算,公式和逐模型数据见我们的 KV 缓存详解

完整算例(Q4_K_M,8K 上下文)

模型权重KV 缓存开销合计判定
Llama 3.2 3B2.0 GB0.9 GB1.5 GB4.4 GB8GB 显卡即可
Llama 3.1 8B4.9 GB1.1 GB1.5 GB7.5 GB12GB 显卡轻松
Mistral Small 24B14.7 GB1.3 GB1.5 GB17.5 GB24GB 舒适,16GB 需降 Q3
Qwen3 32B20.1 GB2.1 GB1.5 GB23.7 GB24GB 显卡勉强
Llama 3.3 70B43.2 GB2.7 GB1.5 GB47.4 GB需要 2×24GB 或 48GB 卡
gpt-oss-120b(MoE)71.5 GB0.6 GB¹1.5 GB73.6 GB96GB Mac 或 4×24GB
DeepSeek-R1 671B411.0 GB0.6 GB¹1.5 GB413.1 GB只能用云端

¹ DeepSeek-R1 使用 MLA 注意力机制、gpt-oss-120b 使用 GQA 加滑窗注意力,KV 缓存都被大幅压缩,详见我们的 KV 缓存指南。

按显卡档位对号入座

把上表反过来看,就是每张卡能跑什么。判定口径:需求 ≤ 显存 × 80% 为「舒适」,≤ 100% 为「勉强」。

  • 12GB(RTX 3060):8B Q4 舒适(7.5GB);甚至可以上 8B Q8(约 11.1GB,勉强)。16B 以上建议直接降档或换卡。
  • 16GB(RTX 4070 Ti Super):8B Q8 舒适;Mistral 24B 这类 24B 模型 Q4 装不下(17.5GB),降到 Q3_K_M 后约 14.8GB,勉强可行。
  • 24GB(RTX 3090/4090):24B Q4 舒适;Qwen3-32B Q4 勉强(23.7GB);Gemma-3-27B Q4 在 8K 下勉强(22.4GB),但上下文拉到 32K 时 KV 缓存膨胀到 16.6GB,合计约 35GB,直接出局。
  • 32GB(RTX 5090):Qwen3-32B Q4 可以带满 32K 上下文(约 30.2GB,勉强)。70B 即使降到 Q2 也要约 32.2GB,仍然装不下。
  • 48GB(RTX A6000 / 2×24GB):70B Q4 的入场券,47.4GB 刚好「勉强」。
  • Apple 统一内存:可用显存按标称 × 0.75 折算。Mac mini M4 Pro 48GB 实际可用约 36GB,跑 Qwen3-32B Q4 很舒适;96GB 的 Mac Studio(可用约 72GB)是 gpt-oss-120b 的最低门槛,刚好踩线。

显存决定能不能跑,带宽决定跑多快

装下只是第一步。生成速度的理论上限 ≈ 显存带宽 × 0.75 ÷ 每 token 需读取的权重大小(理论估算,实际受框架/驱动影响,误差 ±30%)。几个对照:

  • 8B Q4:RTX 3060(360 GB/s)约 55 tok/s,RTX 4090(1008 GB/s)约 154 tok/s,Mac mini M4 Pro(273 GB/s)约 42 tok/s。
  • Qwen3-32B Q4 在 Mac mini M4 Pro 上显存很宽裕,但只有约 10 tok/s——能跑和好用是两回事。
  • MoE 模型每 token 只读激活参数:Qwen3-30B-A3B 在 RTX 4090 上理论约 370 tok/s,和一个 3B 稠密模型相当,代价是 21GB 显存。

最惨的情况是装不下硬跑:CPU 卸载会把等效带宽压到系统内存的 60–100 GB/s。70B Q4 从双 4090 的约 30 tok/s 直接掉到约 1.4 tok/s,慢 20 倍。显存差 1GB 时宁可降一档量化,也不要靠卸载补上。

实操:五步算出任何模型的显存需求

  1. 查参数量:Hugging Face 模型页或文件名里都写着(7B、32B、A3B 等)。MoE 注意区分总参数和激活参数。
  2. 算权重:参数量 × 速查表中的每 1B 占用。想精确到具体档位,用本站显存计算器,数字口径与本文完全一致。
  3. 算 KV 缓存:按 8K 上下文,8B 级加约 1GB、30B 级加约 2GB、70B 级加约 3GB 粗估;要长上下文就按比例放大。不知道架构常数时,这个粗估足够做购卡决策。
  4. 加 1.5GB 运行时开销
  5. 对比可用显存:独显直接用标称值,Apple 统一内存 × 0.75。需求 ≤ 可用 × 80% 算舒适,超过 100% 就别硬上。

装不下时的取舍顺序:降一档量化 > 缩短上下文 > 开 q8 KV 缓存 > 加卡 > CPU 卸载。我们的推荐逻辑也按这个来——勉强的 Q4 永远优于宽裕的 Q2,质量损失比显存余量更影响体验。

什么时候用哪一档

  • Q8_0 / Q6_K:显存宽裕且任务对质量敏感(代码、数学、长文写作)。12GB 跑 8B、24GB 跑 13B 时值得上 Q8。
  • Q4_K_M:默认答案。日常对话、总结、翻译,质量损失几乎不可察觉,显存省 70%。
  • Q3_K_M:边界救场——16GB 想跑 24B、24GB 想跑 32B 长上下文时的现实选择,质量开始可感知但可用。
  • Q2_K:仅用于「我就想知道 70B 说话什么味儿」的尝鲜场景。质量损失明显,不要用于正经工作。

常见误区

「GGUF 文件 5GB,所以 8GB 显卡够了。」 文件体积 ≈ 权重,加载后还要加 KV 缓存和约 1.5GB 运行时开销。5GB 的文件实际需要约 7.5GB。

「MoE 只需加载激活参数。」 错。每个 token 生成时才决定走哪些专家,所以全部专家必须常驻显存。激活参数只影响速度,不影响容量。

「模型标称支持 128K 上下文,我的卡就能用 128K。」 KV 缓存随上下文线性增长,Qwen3-32B 的 KV 从 8K 的 2.1GB 涨到 128K 的 34GB——比权重还大。标称上下文是架构能力,不是你的显存预算。

「每张 24GB 卡就是 24GB 可用。」 多卡拼接时显存可以直接相加,但 macOS/Windows 桌面、浏览器都会占显存;Apple 统一内存更是要按 0.75 折算。留 20% 余量是经验底线。

心算口诀

经验法则:Q4_K_M 下 GB ≈ 0.6 × 参数十亿数。 8B → 约 5GB,30B → 约 18GB,70B → 约 43GB。8K 上下文再加约 2.5GB 的 KV 缓存与开销,上下文更长则再加。

MoE 模型(DeepSeek-R1、gpt-oss、Qwen3-A3B)仍需把全部参数装入显存,但生成速度取决于小得多的激活参数量。这就是为什么 gpt-oss-120b 需要 74GB 显存却跑得挺快。

常见问题

7B 或 8B 模型需要多少显存?

Q4_K_M 下权重约 4.9GB,8K 上下文的 KV 缓存约 1.1GB,再加约 1.5GB 运行时开销,合计约 7.5GB。任何 12GB 显卡都能轻松运行,甚至可以上 Q8(约 11.1GB,刚好装下)。

70B 模型需要多少显存?

Q4_K_M 下含 KV 缓存与开销合计约 47GB,单张消费级显卡放不下。两张 24GB 显卡(48GB)或一张 48GB 的 RTX A6000 可以勉强运行,64GB 以上才算宽裕。

为什么速查表以 Q4_K_M 为默认档?

Q4_K_M 是社区标准:相比 FP16 省约 70% 显存,而在对话场景中大多数用户察觉不到质量损失。所有主流运行时(llama.cpp、Ollama、LM Studio)都把它作为默认下载档。

GGUF 文件只有 5GB,为什么加载后占了 7.5GB 显存?

文件体积约等于权重本身。KV 缓存和运行时开销(CUDA 上下文、计算缓冲区)是模型加载后才在显存里分配的,不体现在文件大小里。估算显存时永远要在文件大小之上再加 2.5GB 左右。

MoE 模型是不是只需把激活参数装进显存?

不是。所有专家都必须常驻显存,因为生成每个 token 时才会决定激活哪些专家。激活参数量只决定速度快慢,不决定显存占用——gpt-oss-120b 需要约 74GB 显存,但生成速度按 5.1B 激活参数算。

来源