GPUFits

模型库 / gpt-oss-120b

gpt-oss-120b 显存需求与显卡搭配

gpt-oss-120b 把 MoE 推到了本地可行的极限边缘:116.8B 总参数(128 专家、每 token 激活 4)、激活参数仅 5.1B,Apache-2.0 协议。显存按总参数算:Q4_K_M @8K 约 73.6GB,单卡只有 A100/H100 80GB 勉强装下;Mac Studio M3 Ultra 96GB 可用 72GB,差一口气,降到 Q3_K_M(约 60GB)勉强可行——这是它最现实的家用路径。

速度按 5.1B 激活算:M3 Ultra 理论约 200 tok/s,比 70B 稠密快一个数量级——这是 MoE 在大模型端的真正威力。半数层滑窗注意力 + headDim 64 让 KV 极小(8K 约 0.6GB),128K 长上下文也不吃力。对比 DeepSeek-R1:同为 MoE 推理强者,它只需要约 1/6 的显存,是“消费级天花板能摸到的最强推理”;R1 满血则属于数据中心。

架构规格

总参数116.8B
激活参数(MoE:显存按总参数装,速度按激活参数跑) 5.1B
层数36
KV 头数 8
Head 维度64
原生上下文128K
开源协议apache-2.0
每 token KV 字节数(fp16)72.0 KB

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 124.2 GB 126.3 GB
Q6_K 95.9 GB 98.0 GB
Q4_K_M 71.5 GB 73.6 GB
Q3_K_M 58.4 GB 60.5 GB
Q2_K 46.3 GB 48.4 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 试算 →
RTX 3090 24.0 GB 本地不可行 需 4 张 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 试算 →
RTX 4090 24.0 GB 本地不可行 需 4 张 试算 →
RTX 5090 32.0 GB 本地不可行 需 3 张 试算 →
RTX A6000 48.0 GB 本地不可行 需 2 张 试算 →
A100 80GB 80.0 GB 勉强装下 Q4_K_M ≈490 tok/s 试算 →
H100 80GB 80.0 GB 勉强装下 Q4_K_M ≈804 tok/s 试算 →
RX 7900 XTX 24.0 GB 本地不可行 需 4 张 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 本地不可行 需 3 张 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 本地不可行 需 2 张 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 需要多卡 Q3_K_M ≈241 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

什么硬件能跑 gpt-oss-120b?
Q4_K_M 约 73.6GB:A100/H100 80GB 勉强;Mac Studio M3 Ultra(可用 72GB)需降到 Q3_K_M(约 60GB,勉强);或 2×48GB(A6000)多卡。消费单卡全部出局。
gpt-oss-120b 有多快?
激活参数仅 5.1B:M3 Ultra 理论约 200 tok/s,A100 约 490 tok/s——比 70B 稠密快一个数量级,这是 MoE“显存按总参数、速度按激活参数”的极致体现。
gpt-oss-120b 和 DeepSeek-R1 怎么选?
本地硬件选 gpt-oss-120b:Q3/Q4 在 60-74GB 量级,Mac Studio 或双卡可达;R1 满血 Q4 约 413.6GB,本地只有数据中心级多卡或 1.58bit 动态量化可行,质量折损需自行评估。

相关指南

在显卡兼容性查询工具中试算 gpt-oss-120b →

数据核实于 2026-09-01