GPU 对比 / RTX 4090 vs RTX 5090
RTX 4090 vs RTX 5090:跑本地 LLM 怎么选
能按原价买到就选 5090:32B 档从勉强变宽裕、速度快 78%;按现价两张卡都不理性——4090 停产溢价,5090 市价约 2 倍 MSRP。
规格对照
| RTX 4090 | RTX 5090 | |
|---|---|---|
| 标称显存 | 24 GB | 32 GB |
| 可用显存(模型可用) | 24.0 GB | 32.0 GB |
| 显存带宽 | 1008 GB/s | 1792 GB/s |
| 类型 | 独显 | 独显 |
| 发布年份 | 2022 | 2025 |
| MSRP | $1,599 | $1,999 |
| 二手参考价 | $2,400 | — |
| TDP | 450 W | 575 W |
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | RTX 4090 | 理论速度 | RTX 5090 | 理论速度 |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | ≈385 | 宽裕 | ≈684 |
| Llama 3.1 8B | 7.5 GB | 宽裕 | ≈154 | 宽裕 | ≈273 |
| Qwen3 8B | 7.7 GB | 宽裕 | ≈151 | 宽裕 | ≈268 |
| Phi-4 14B | 12.2 GB | 宽裕 | ≈84 | 宽裕 | ≈149 |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | ≈51 | 宽裕 | ≈91 |
| Gemma 3 27B | 22.4 GB | 勉强装下 | ≈45 | 宽裕 | ≈80 |
| Qwen3.8 27B | 20.7 GB | 勉强装下 | ≈44 | 宽裕 | ≈79 |
| Muse Glimmer 30B | 20.1 GB | 勉强装下 | ≈42 | 宽裕 | ≈74 |
| Qwen3 30B-A3B | 21.0 GB | 勉强装下 | ≈374 | 宽裕 | ≈665 |
| Qwen3 32B | 23.7 GB | 勉强装下 | ≈38 | 宽裕 | ≈67 |
| gpt-oss-20b | 14.7 GB | 宽裕 | ≈343 | 宽裕 | ≈610 |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | — | 本地不可行 | — |
| gpt-oss-120b | 73.6 GB | 本地不可行 | — | 本地不可行 | — |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | 本地不可行 | — |
高亮行 = 两卡判定不同的分水岭模型。 理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。判定为需要多卡/不可行时不显示速度。
性价比对比
| RTX 4090 | RTX 5090 | |
|---|---|---|
| 每美元带宽 | 0.42 GB/s/$ | 0.90 GB/s/$ |
| 每美元可用显存 | 0.010 GB/$ | 0.016 GB/$ |
价格口径:RTX 4090 = 二手参考价; RTX 5090 = MSRP(暂无二手价);二手价为市场参考价【估】,波动见分析。
对比分析
5090 对 4090 的升级是双重的。带宽 1008→1792 GB/s(+78%),decode 速度全面同比例提升:8B Q4 理论约 154→273 tok/s,Qwen3 32B Q4 约 38→67 tok/s——32B 档第一次从“可读”变成“流畅聊天”。显存 24→32GB 则让整个 27-32B 档(Gemma 3 27B、Qwen3.8 27B、Muse Glimmer 30B、Qwen3 30B-A3B、Qwen3 32B)从“勉强”整体升为“宽裕”,Qwen3 32B 甚至能勉强上 Q6_K(约 30.6GB),Gemma 3 27B 的大 KV 缓存也不再有长上下文焦虑。
但两边价格都已失真:4090 已停产,2026-08 二手 $2,350-2,500,比 MSRP 高 50% 以上;5090 的 $1,999 MSRP 形同虚设,新卡实际 $4,288-4,381、二手 $3,590-4,304(约 2.1× MSRP)。于是出现讽刺一幕:按真实成交价算,每美元带宽 4090(0.42)反而垫底,5090 按 MSRP 算是 0.90 的漂亮数字——前提是你真能原价买到。
结论分三种情况:能按 MSRP 或接近价拿到 5090,它是单卡 32B 的唯一答案,比 4090 值;按约 $4,300 的现价纯跑 LLM,两张二手 3090($2,200、48GB)显存更多还便宜一半;已有 4090 的用户不必升级——显存档位没变,只是更快,等下一代显存扩容再说。
常见问题
- RTX 5090 比 4090 跑 LLM 快多少?
- 带宽 1792 vs 1008 GB/s,理论 decode 快 78%:8B Q4 约 154→273 tok/s,Qwen3 32B Q4 约 38→67 tok/s。32GB 显存还让 27-32B 档整体从“勉强”升为“宽裕”。
- RTX 5090 能跑 70B 吗?
- 单卡不能:70B Q4 约需 47.4GB,超过 32GB,需双卡。它比 4090 多出的 8GB 解决的是 27-32B 档的量化余量(Qwen3 32B 可勉强上 Q6_K,约 30.6GB),不是上一个模型档位。
- 现在该买 4090 还是 5090?
- 按现价都不理性:二手 4090 约 $2,350-2,500(停产溢价),5090 实际 $3,590-4,300(约 2 倍 MSRP)。能原价买到 5090 就上;否则纯 LLM 用途,两张二手 3090($2,200/48GB)比任一单卡都实用。
相关指南
- 显存带宽为什么决定 LLM 推理速度:decode 机制与估算公式
- 2026 年本地大模型显卡选购指南:全预算覆盖
- FP8、NVFP4 与 GGUF 量化怎么选:数据中心格式 vs llama.cpp 格式
数据核实于 2026-09-01