显卡库 / RTX 5090
RTX 5090 跑本地 LLM:能跑什么模型、速度多快
RTX 5090 是带宽怪兽:32GB GDDR7、1792 GB/s,带宽是 4090 的 1.78 倍——跑 8B 理论约 273 tok/s、Qwen3 32B Q4 约 67 tok/s,32B 档第一次有了“流畅聊天”的消费级体验。32GB 显存让 Qwen3 32B Q4(约 23.7GB)真正宽裕,Q6_K(约 30.6GB)勉强可上;Gemma 3 27B 的大 KV 也不再是问题。
问题全在价格与功耗:MSRP $1,999 只是传说,2026 年 8 月新卡实际 $4,288-4,381、二手 $3,590-4,304,约 2.1× 官方价;TDP 575W,需要 1000W 级电源与良好风道。买它的逻辑只有一个:要单卡最强体验且不差钱。理性替代方案:两张二手 3090(约 $2,200、48GB)或 Mac Studio M3 Ultra($5,299、可用 72GB 统一内存)分别赢下显存容量战的上下半场。
规格
| 标称显存 | 32 GB |
| 可用显存(模型可用) | 32.0 GB |
| 显存带宽 | 1792 GB/s |
| 类型 | 独显 |
| 发布年份 | 2025 |
| MSRP | $1,999 |
| TDP | 575 W |
性价比指标
每美元带宽
0.90 GB/s/$
每美元可用显存
0.016 GB/$
按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈209 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈84 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈82 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | Q8_0 | ≈86 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | Q8_0 | ≈53 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 宽裕 | Q6_K | ≈60 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 宽裕 | Q6_K | ≈59 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 宽裕 | Q6_K | ≈55 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 宽裕 | Q6_K | ≈496 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 宽裕 | Q6_K | ≈50 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | Q8_0 | ≈351 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RTX 5090 32GB 能跑什么模型?
- Q4_K_M @8K:32B 档宽裕(Qwen3 32B 约 23.7GB、Mistral Small 24B 约 17.5GB);Gemma 3 27B 也能留长上下文余量。70B 需双卡。
- RTX 5090 比 4090 快多少?
- LLM decode 看带宽:1792 vs 1008 GB/s,理论快 78%。8B 从约 154 tok/s 提到约 273 tok/s,32B 从约 37 提到约 67 tok/s——32B 档从“可读”变成“流畅”。
- RTX 5090 值得按现价买吗?
- 纯 LLM 账算不过来:现价约 $4,300 能买两张 3090(48GB)还剩 $2,000。要单卡 32B 流畅 + 游戏旗舰 + 不折腾,才轮到它;MSRP $1,999 若能原价买到则另当别论。
相关指南
- 显存带宽为什么决定 LLM 推理速度:decode 机制与估算公式
- FP8、NVFP4 与 GGUF 量化怎么选:数据中心格式 vs llama.cpp 格式
- 2026 年本地大模型显卡选购指南:全预算覆盖
数据核实于 2026-09-01