模型库 / gpt-oss-20b
gpt-oss-20b 显存需求与显卡搭配
gpt-oss-20b 是 OpenAI 时隔多年放出的开放权重模型:20.9B 总参数的 MoE(32 专家、每 token 激活 4),激活参数仅 3.6B,Apache-2.0 协议。架构上有一半层是 2048 滑窗注意力、headDim 64,KV 缓存极小(8K 约 0.4GB);原生支持 MXFP4 低精度,GGUF 生态也已成熟,128K 上下文。
Q4_K_M @8K 总需求约 14.7GB,16GB 显卡勉强装下——这是它最大的卖点:一张 RTX 4070 Ti Super 就能跑 OpenAI 系的推理风格(harmony 输出格式、可调 reasoning effort)。速度按 3.6B 激活参数算,4090 理论约 343 tok/s。注意它默认带思维链,简单任务记得调低 effort,否则白白烧 token。适合想要强推理但只有 16GB 卡的用户;24GB 卡可上 Q6_K(约 19GB)。
架构规格
| 总参数 | 20.9B |
| 激活参数(MoE:显存按总参数装,速度按激活参数跑) | 3.6B |
| 层数 | 24 |
| KV 头数 | 8 |
| Head 维度 | 64 |
| 原生上下文 | 128K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 48.0 KB |
滑窗提示:半数层为滑窗注意力,上表按标准全注意力公式计算 KV,实际长上下文占用更低,判定偏保守。
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 22.2 GB | 24.1 GB |
| Q6_K | 17.2 GB | 19.1 GB |
| Q4_K_M | 12.8 GB | 14.7 GB |
| Q3_K_M | 10.4 GB | 12.4 GB |
| Q2_K | 8.3 GB | 10.2 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | Q2_K | ≈189 tok/s | 试算 → |
| RTX 3090 | 24.0 GB | 宽裕 | Q6_K | ≈237 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 勉强装下 | Q4_K_M | ≈229 tok/s | 试算 → |
| RTX 4090 | 24.0 GB | 宽裕 | Q6_K | ≈256 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | Q8_0 | ≈351 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | FP16 | ≈80 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈212 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈349 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 宽裕 | Q6_K | ≈244 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | Q8_0 | ≈53 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | FP16 | ≈57 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈85 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 16GB 显卡能跑 gpt-oss-20b 吗?
- 勉强装下。Q4_K_M @8K 约 14.7GB,16GB 卡(RTX 4070 Ti Super)装下后余量约 1.3GB;KV 缓存极小(约 0.4GB),长上下文也不吃力。
- gpt-oss-20b 和 Qwen3 30B-A3B 怎么选?
- 16GB 卡只能选 gpt-oss-20b(Q4 约 14.7GB);24GB 卡两者皆可——要 OpenAI 系推理风格与更小 KV 选 gpt-oss,要更稠密的知识覆盖与 Qwen 生态选 30B-A3B。
- gpt-oss-20b 的 reasoning effort 是什么?
- OpenAI harmony 格式的思维链强度开关(low/medium/high)。简单任务用 low 省 token,数学代码用 high;这是它与普通聊天模型最大的使用差异。
相关指南
数据核实于 2026-09-01