GPUFits

模型库 / Gemma 3 27B

Gemma 3 27B 显存需求与显卡搭配

Gemma 3 27B 是 Google 从 Gemini 蒸馏下来的稠密旗舰:27.4B 参数、62 层、原生 128K 上下文、支持视觉输入,英语质量与指令遵循在 30B 档属第一梯队。硬件上要特别注意它的 KV 缓存:62 层 × 16 KV 头的设计让 8K fp16 KV 高达约 4.2GB——是同级模型的 2 到 3 倍。Q4_K_M @8K 总需求约 22.4GB,在 24GB 卡上是“勉强装下”而非宽裕。

长上下文会很快顶爆显存:32K 上下文 KV 就约 16.6GB,超过 16K 强烈建议把 KV 量化到 q8(直接减半)。协议是 gemma 自定义条款,商用前需阅读使用限制,不如 Apache-2.0 省心。对比 Mistral Small 24B:质量略胜、显存更紧、协议更严;24GB 卡想留长上下文余量的选后者更稳,32GB 的 RTX 5090 才是它的舒适区。

架构规格

总参数27.4B
激活参数 27.4B
层数62
KV 头数 16
Head 维度128
原生上下文128K
开源协议gemma
每 token KV 字节数(fp16)496.0 KB

Gemma 3 的 62 层 × 16 KV 头设计使 KV 缓存显著大于同级模型,长上下文场景务必把 KV 量化到 q8。

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 29.1 GB 34.8 GB
Q6_K 22.5 GB 28.2 GB
Q4_K_M 16.8 GB 22.4 GB
Q3_K_M 13.7 GB 19.4 GB
Q2_K 10.9 GB 16.5 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 需 2 张 试算 →
RTX 3090 24.0 GB 勉强装下 Q4_K_M ≈42 tok/s 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 需 2 张 试算 →
RTX 4090 24.0 GB 勉强装下 Q4_K_M ≈45 tok/s 试算 →
RTX 5090 32.0 GB 宽裕 Q6_K ≈60 tok/s 试算 →
RTX A6000 48.0 GB 宽裕 Q8_0 ≈20 tok/s 试算 →
A100 80GB 80.0 GB 宽裕 FP16 ≈28 tok/s 试算 →
H100 80GB 80.0 GB 宽裕 FP16 ≈46 tok/s 试算 →
RX 7900 XTX 24.0 GB 勉强装下 Q4_K_M ≈43 tok/s 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 宽裕 Q8_0 ≈7 tok/s 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 宽裕 Q8_0 ≈14 tok/s 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 宽裕 FP16 ≈11 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

24GB 显卡能跑 Gemma 3 27B 吗?
能但勉强:Q4_K_M @8K 约 22.4GB,余量不足 2GB。建议 KV 量化到 q8、上下文控制在 16K 内;要长上下文请上 32GB 卡(RTX 5090)。
Gemma 3 27B 的 KV 缓存为什么这么大?
62 层 × 16 KV 头的组合:每 token KV 约 508KB(fp16),是 Qwen3 32B 的近 2 倍、Mistral Small 24B 的 3 倍多。8K 就占 4.2GB,128K 全长理论上约 67GB。
Gemma 3 27B 可以商用吗?
可以但有条件:Gemma 使用条款禁止清单内用途并要求下游传递使用限制,商用前请读一遍 Gemma Terms of Use,不如 Apache-2.0 模型省心。

相关指南

在显卡兼容性查询工具中试算 Gemma 3 27B →

数据核实于 2026-09-01