显卡库 / RTX 3090
RTX 3090 跑本地 LLM:能跑什么模型、速度多快
RTX 3090 是本地 LLM 圈的硬通货:24GB 显存、936 GB/s 带宽,2020 年发布至今仍是二手市场性价比之王——2026 年 8 月二手约 $1,095-1,181,新卡/存货挂牌 $1,630 起,24GB 显存溢价持续。它能宽裕跑 24B 级(Mistral Small Q4 约 17.5GB)、勉强装下 Qwen3 32B(约 23.7GB),两张层拆分即可跑 70B Q4——这是它价格坚挺的根本原因:本地 LLM 最重要的两个数字(显存容量、带宽)它都够。
缺点全是物理层面的:350W TDP、GDDR6X 显存温度高,二手必查显存散热垫状态与挖矿史;双槽 blower 版适合多卡堆叠,三风扇版适合单卡。它还有 NVLink 接口,虽然推理层拆分用不上。对比 RTX 4090:带宽只差 7%,二手价只有一半——纯 LLM 推理,买 3090 是更理性的选择,省下的钱够再买半张。
规格
| 标称显存 | 24 GB |
| 可用显存(模型可用) | 24.0 GB |
| 显存带宽 | 936 GB/s |
| 类型 | 独显 |
| 发布年份 | 2020 |
| MSRP | $1,499 |
| 二手参考价 | $1,100较上月 +10% |
| TDP | 350 W |
性价比指标
每美元带宽
0.85 GB/s/$
每美元可用显存
0.022 GB/$
按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈109 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈44 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈43 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | Q8_0 | ≈45 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | Q6_K | ≈36 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 勉强装下 | Q4_K_M | ≈42 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 勉强装下 | Q5_K_M | ≈35 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 勉强装下 | Q5_K_M | ≈33 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 勉强装下 | Q4_K_M | ≈347 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 勉强装下 | Q4_K_M | ≈35 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | Q6_K | ≈237 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RTX 3090 能跑什么模型?
- Q4_K_M @8K:24B 档宽裕、Qwen3 32B 勉强(约 23.7GB)、70B 需双卡。MoE 的 Qwen3 30B-A3B 在它上面理论约 347 tok/s,体验极佳。
- 二手 RTX 3090 怎么验机?
- 重点三项:GDDR6X 显存温度(跑满载看 junction temp,超 100°C 需换散热垫)、挖矿史(问清使用场景,看保修贴)、风扇与供电接口状态。blower 版多卡友好但噪音大。
- RTX 3090 和 RTX 4090 怎么选?
- 纯 LLM:3090,带宽只差 7%、二手价一半。要单卡游戏兼顾、更低功耗、更新架构才考虑 4090——但二手 4090 约 $2,400,已远超其 LLM 价值。
相关指南
数据核实于 2026-09-01