GPUFits

显卡库 / RTX 4090

RTX 4090 跑本地 LLM:能跑什么模型、速度多快

RTX 4090 是消费级单卡速度之王,也是市场失灵的经典案例:已停产,2026 年 8 月二手约 $2,350-2,500(近 3 月 +9.7%)——比 $1,599 的发售价高 50% 以上,价格完全锚定 RTX 5090 而非自身发售价。1008 GB/s 带宽 + 24GB 显存让它跑 8B Q4 理论约 154 tok/s、Qwen3 32B Q4 约 38 tok/s,单卡覆盖到 32B 档;两张可战 70B。

买它前算清账:二手 4090 ≈ 两张二手 3090 的价钱,后者给出 48GB 显存与相近的聚合带宽——纯 LLM 推理,双 3090 更值;要单卡静音、相对低功耗、游戏兼顾,才是 4090 的画像。450W TDP 与 12VHPWR 接口的烧毁史是二手验机要点(检查端子变色、插紧度)。预算够且只要一张卡,它依然不会错;只是它早已不是“理性”选择,而是“省心”选择。

规格

标称显存24 GB
可用显存(模型可用)24.0 GB
显存带宽1008 GB/s
类型独显
发布年份2022
MSRP$1,599
二手参考价$2,400较上月 +118%
TDP450 W

性价比指标

每美元带宽
0.42 GB/s/$
每美元可用显存
0.010 GB/$

按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈118 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈47 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈46 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 Q8_0 ≈48 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 Q6_K ≈38 tok/s 试算 →
Gemma 3 27B 22.4 GB 勉强装下 Q4_K_M ≈45 tok/s 试算 →
Qwen3.8 27B 20.7 GB 勉强装下 Q5_K_M ≈38 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 勉强装下 Q5_K_M ≈36 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 勉强装下 Q4_K_M ≈374 tok/s 试算 →
Qwen3 32B 23.7 GB 勉强装下 Q4_K_M ≈38 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 Q6_K ≈256 tok/s 试算 →
Llama 3.3 70B 47.4 GB 本地不可行 需 2 张 试算 →
gpt-oss-120b 73.6 GB 本地不可行 需 4 张 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

RTX 4090 能跑什么模型?
Q4_K_M @8K:24B 档宽裕、Qwen3 32B 勉强、70B 需双卡。MoE 模型体验极佳:Qwen3 30B-A3B 理论约 374 tok/s,gpt-oss-20b 约 343 tok/s。
二手 RTX 4090 为什么比发售价还贵?
已停产 + 24GB 显存溢价 + 价格锚定 RTX 5090(实际售价 2 倍 MSRP)。2026-08 二手 $2,350-2,500,是纯市场定价,与 $1,599 的 MSRP 已无关系。
二手 4090 验机注意什么?
12VHPWR 接口是重点:检查端子有无变色/熔化痕迹、线材是否原装;其次跑满载看结温与风扇。450W TDP 需要 850W 以上电源与良好风道。

相关指南

在显卡兼容性查询工具中试算 RTX 4090 →

数据核实于 2026-09-01