显卡库 / RTX 4090
RTX 4090 跑本地 LLM:能跑什么模型、速度多快
RTX 4090 是消费级单卡速度之王,也是市场失灵的经典案例:已停产,2026 年 8 月二手约 $2,350-2,500(近 3 月 +9.7%)——比 $1,599 的发售价高 50% 以上,价格完全锚定 RTX 5090 而非自身发售价。1008 GB/s 带宽 + 24GB 显存让它跑 8B Q4 理论约 154 tok/s、Qwen3 32B Q4 约 38 tok/s,单卡覆盖到 32B 档;两张可战 70B。
买它前算清账:二手 4090 ≈ 两张二手 3090 的价钱,后者给出 48GB 显存与相近的聚合带宽——纯 LLM 推理,双 3090 更值;要单卡静音、相对低功耗、游戏兼顾,才是 4090 的画像。450W TDP 与 12VHPWR 接口的烧毁史是二手验机要点(检查端子变色、插紧度)。预算够且只要一张卡,它依然不会错;只是它早已不是“理性”选择,而是“省心”选择。
规格
| 标称显存 | 24 GB |
| 可用显存(模型可用) | 24.0 GB |
| 显存带宽 | 1008 GB/s |
| 类型 | 独显 |
| 发布年份 | 2022 |
| MSRP | $1,599 |
| 二手参考价 | $2,400较上月 +118% |
| TDP | 450 W |
性价比指标
每美元带宽
0.42 GB/s/$
每美元可用显存
0.010 GB/$
按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈118 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈47 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈46 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | Q8_0 | ≈48 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | Q6_K | ≈38 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 勉强装下 | Q4_K_M | ≈45 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 勉强装下 | Q5_K_M | ≈38 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 勉强装下 | Q5_K_M | ≈36 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 勉强装下 | Q4_K_M | ≈374 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 勉强装下 | Q4_K_M | ≈38 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | Q6_K | ≈256 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RTX 4090 能跑什么模型?
- Q4_K_M @8K:24B 档宽裕、Qwen3 32B 勉强、70B 需双卡。MoE 模型体验极佳:Qwen3 30B-A3B 理论约 374 tok/s,gpt-oss-20b 约 343 tok/s。
- 二手 RTX 4090 为什么比发售价还贵?
- 已停产 + 24GB 显存溢价 + 价格锚定 RTX 5090(实际售价 2 倍 MSRP)。2026-08 二手 $2,350-2,500,是纯市场定价,与 $1,599 的 MSRP 已无关系。
- 二手 4090 验机注意什么?
- 12VHPWR 接口是重点:检查端子有无变色/熔化痕迹、线材是否原装;其次跑满载看结温与风扇。450W TDP 需要 850W 以上电源与良好风道。
相关指南
数据核实于 2026-09-01