模型库 / gpt-oss-120b
gpt-oss-120b 显存需求与显卡搭配
gpt-oss-120b 把 MoE 推到了本地可行的极限边缘:116.8B 总参数(128 专家、每 token 激活 4)、激活参数仅 5.1B,Apache-2.0 协议。显存按总参数算:Q4_K_M @8K 约 73.6GB,单卡只有 A100/H100 80GB 勉强装下;Mac Studio M3 Ultra 96GB 可用 72GB,差一口气,降到 Q3_K_M(约 60GB)勉强可行——这是它最现实的家用路径。
速度按 5.1B 激活算:M3 Ultra 理论约 200 tok/s,比 70B 稠密快一个数量级——这是 MoE 在大模型端的真正威力。半数层滑窗注意力 + headDim 64 让 KV 极小(8K 约 0.6GB),128K 长上下文也不吃力。对比 DeepSeek-R1:同为 MoE 推理强者,它只需要约 1/6 的显存,是“消费级天花板能摸到的最强推理”;R1 满血则属于数据中心。
架构规格
| 总参数 | 116.8B |
| 激活参数(MoE:显存按总参数装,速度按激活参数跑) | 5.1B |
| 层数 | 36 |
| KV 头数 | 8 |
| Head 维度 | 64 |
| 原生上下文 | 128K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 72.0 KB |
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 124.2 GB | 126.3 GB |
| Q6_K | 95.9 GB | 98.0 GB |
| Q4_K_M | 71.5 GB | 73.6 GB |
| Q3_K_M | 58.4 GB | 60.5 GB |
| Q2_K | 46.3 GB | 48.4 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 3090 | 24.0 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 4090 | 24.0 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| RTX 5090 | 32.0 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| RTX A6000 | 48.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| A100 80GB | 80.0 GB | 勉强装下 | Q4_K_M | ≈490 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 勉强装下 | Q4_K_M | ≈804 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 需要多卡 | Q3_K_M | ≈241 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 什么硬件能跑 gpt-oss-120b?
- Q4_K_M 约 73.6GB:A100/H100 80GB 勉强;Mac Studio M3 Ultra(可用 72GB)需降到 Q3_K_M(约 60GB,勉强);或 2×48GB(A6000)多卡。消费单卡全部出局。
- gpt-oss-120b 有多快?
- 激活参数仅 5.1B:M3 Ultra 理论约 200 tok/s,A100 约 490 tok/s——比 70B 稠密快一个数量级,这是 MoE“显存按总参数、速度按激活参数”的极致体现。
- gpt-oss-120b 和 DeepSeek-R1 怎么选?
- 本地硬件选 gpt-oss-120b:Q3/Q4 在 60-74GB 量级,Mac Studio 或双卡可达;R1 满血 Q4 约 413.6GB,本地只有数据中心级多卡或 1.58bit 动态量化可行,质量折损需自行评估。
相关指南
数据核实于 2026-09-01