GPU 性价比排行榜:本地跑大模型,哪张卡最值?
市面上大多数「显卡推荐」只是参数罗列。这个排行榜不一样:四个榜单全部由本站数据库在构建时实算, 覆盖 12 张消费级/专业级 GPU 与 Apple 统一内存机型,排名口径如下——
- 价格:二手价优先;二手价字段为 0 的卡(RTX 5090、A100、H100、Apple 机型)用 MSRP 或市场参考价。二手价为 eBay 已售/挂牌口径,月度更新。
- 速度:带宽 × 0.75 ÷ 每 token 权重字节数的理论估算,实际受框架/驱动/CPU 影响,误差约 ±30%。
- 显存:Apple 统一内存按 75% 可用折算(需与系统和应用共享),独显取标称值。
- 数据核实日期:2026-09-01。
榜一 · 每美元带宽
显存带宽决定 LLM 推理速度上限。公式:带宽(GB/s)÷ 价格。
| # | 显卡 | 带宽 | 价格 | GB/s per $ |
|---|---|---|---|---|
| 1 | RX 7900 XTX | 960 GB/s | $650 | 1.48 |
| 2 | RTX 3060 12GB | 360 GB/s | $260较上月 +44% | 1.38 |
| 3 | RTX 5090 | 1,792 GB/s | $1,999 | 0.90 |
| 4 | RTX 4070 Ti Super | 672 GB/s | $760较上月 +38% | 0.88 |
| 5 | RTX 3090 | 936 GB/s | $1,100较上月 +10% | 0.85 |
| 6 | RTX 4090 | 1,008 GB/s | $2,400较上月 +118% | 0.42 |
| 7 | RTX A6000 | 768 GB/s | $2,800 | 0.27 |
| 8 | Mac Studio M4 Max (64GB) | 546 GB/s | $2,899 | 0.19 |
| 9 | Mac Studio M3 Ultra (96GB) | 819 GB/s | $5,299 | 0.15 |
| 10 | Mac mini M4 Pro (48GB) | 273 GB/s | $1,799 | 0.15 |
| 11 | A100 80GB | 2,039 GB/s | $15,000 | 0.14 |
| 12 | H100 80GB | 3,350 GB/s | $30,000 | 0.11 |
RX 7900 XTX 以约 $650 的二手价拿下第一,每美元 1.48 GB/s,是带宽维度的甜点。 RTX 3060 12GB 虽然在 DRAM 涨价潮中二手价较 7 月上涨约 40%(从 $170-220 涨到 $250-275, NVIDIA 甚至以 $339 重新上架零售),仍以 1.39 稳居第二——涨价都撼动不了它的性价比。
RTX 5090 按 $1,999 MSRP 排第三,但注意:它二级市场实际成交已达 2.1× MSRP(新卡 $4,288-4,381),按市价算会跌出前列——能以原价买到才算真香。 垫底的 A100/H100 说明一件事:数据中心卡的带宽单价是消费卡的 10 倍,纯跑推理的个人玩家不必仰望。
榜二 · 每美元显存
显存决定你能装下多大的模型。公式:可用显存 ÷ 价格(Apple 统一内存按 75% 折算)。
| # | 显卡 | 可用显存 | 价格 | GB per $100 |
|---|---|---|---|---|
| 1 | RTX 3060 12GB | 12.0 GB | $260较上月 +44% | 4.62 |
| 2 | RX 7900 XTX | 24.0 GB | $650 | 3.69 |
| 3 | RTX 3090 | 24.0 GB | $1,100较上月 +10% | 2.18 |
| 4 | RTX 4070 Ti Super | 16.0 GB | $760较上月 +38% | 2.11 |
| 5 | Mac mini M4 Pro (48GB)(×0.75) | 36.0 GB | $1,799 | 2.00 |
| 6 | RTX A6000 | 48.0 GB | $2,800 | 1.71 |
| 7 | Mac Studio M4 Max (64GB)(×0.75) | 48.0 GB | $2,899 | 1.66 |
| 8 | RTX 5090 | 32.0 GB | $1,999 | 1.60 |
| 9 | Mac Studio M3 Ultra (96GB)(×0.75) | 72.0 GB | $5,299 | 1.36 |
| 10 | RTX 4090 | 24.0 GB | $2,400较上月 +118% | 1.00 |
| 11 | A100 80GB | 80.0 GB | $15,000 | 0.53 |
| 12 | H100 80GB | 80.0 GB | $30,000 | 0.27 |
RTX 3060 12GB 每百美元 4.6GB 显存,断层式第一,这也是它常年霸占入门推荐的原因。 RX 7900 XTX 以 3.7GB 居次;原价 $999 的 24GB 卡二手只卖 $650,AMD 在显存维度一直是价格屠夫。
RTX 3090 尽管 24GB 显存溢价持续(二手 $1,095-1,181),仍以 2.2GB/$100 排第三,是多卡跑 70B 的性价比主力。 折算后的 Mac mini M4 Pro 48GB(可用 36GB)挤进前五——想要安静、低功耗地装下 30B 级模型,它是 $1,799 价位唯一解。
榜三 · 8B 模型每美元速度
以 Llama 3.1 8B Q4_K_M 为基准(每 token 读取 4.9GB 权重),公式:理论 tok/s ÷ 价格。理论估算,误差 ±30%。
| # | 显卡 | 估算速度 | 价格 | tok/s per $100 |
|---|---|---|---|---|
| 1 | RX 7900 XTX | 约 146 tok/s | $650 | 22.5 |
| 2 | RTX 3060 12GB | 约 55 tok/s | $260较上月 +44% | 21.1 |
| 3 | RTX 5090 | 约 273 tok/s | $1,999 | 13.7 |
| 4 | RTX 4070 Ti Super | 约 102 tok/s | $760较上月 +38% | 13.5 |
| 5 | RTX 3090 | 约 143 tok/s | $1,100较上月 +10% | 13.0 |
| 6 | RTX 4090 | 约 154 tok/s | $2,400较上月 +118% | 6.4 |
| 7 | RTX A6000 | 约 117 tok/s | $2,800 | 4.2 |
| 8 | Mac Studio M4 Max (64GB) | 约 83 tok/s | $2,899 | 2.9 |
| 9 | Mac Studio M3 Ultra (96GB) | 约 125 tok/s | $5,299 | 2.4 |
| 10 | Mac mini M4 Pro (48GB) | 约 42 tok/s | $1,799 | 2.3 |
| 11 | A100 80GB | 约 311 tok/s | $15,000 | 2.1 |
| 12 | H100 80GB | 约 511 tok/s | $30,000 | 1.7 |
跑 8B 小模型,RX 7900 XTX 与 RTX 3060 12GB 的每美元速度几乎打平(22.5 vs 21.1 tok/s/$100), 分别是 $650 与 $260 预算档的甜点——前者速度接近三倍,后者门槛只有零头。RTX 5090 以 13.7 排第三,绝对速度 273 tok/s 是全场消费卡最快,但单价摊薄了优势。
反面教材是 RTX 4090:已停产,二手价锚定 5090 一路涨到 $2,350-2,500,每美元速度只有 3060 的三分之一。只为 8B 模型买 4090,每一分钱都在为停产溢价买单。
榜四 · 70B 大模型最低门槛
舒适运行 Llama 3.3 70B Q4_K_M @ 8K 上下文(总需求 47.4GB = 权重 43.2 + KV 2.7 + 开销 1.5)的最便宜方案,按总价升序。单卡装不下的标注所需卡数,总价 = 单价 × 卡数(未计主板/电源/散热成本);统一内存机型不参与多机堆叠。
| # | 方案 | 卡数 | 总价 | 余量判定 |
|---|---|---|---|---|
| 1 | RTX 3060 12GB需 4 卡 | 4 | $1,040较上月 +44% | 勉强装下 |
| 2 | RX 7900 XTX需 2 卡 | 2 | $1,300 | 勉强装下 |
| 3 | RTX 3090需 2 卡 | 2 | $2,200较上月 +10% | 勉强装下 |
| 4 | RTX 4070 Ti Super需 3 卡 | 3 | $2,280较上月 +38% | 勉强装下 |
| 5 | RTX A6000 | 1 | $2,800 | 勉强装下 |
| 6 | Mac Studio M4 Max (64GB) | 1 | $2,899 | 勉强装下 |
| 7 | RTX 5090需 2 卡 | 2 | $3,998 | 宽裕 |
| 8 | RTX 4090需 2 卡 | 2 | $4,800较上月 +118% | 勉强装下 |
| 9 | Mac Studio M3 Ultra (96GB) | 1 | $5,299 | 宽裕 |
| 10 | A100 80GB | 1 | $15,000 | 宽裕 |
| 11 | H100 80GB | 1 | $30,000 | 宽裕 |
最便宜的 70B 入场券是 4× RTX 3060 12GB($1,040)——但只是勉强装下,且 4 卡的供电、散热和主板插槽都是隐性成本。 真正的甜点是 2× RX 7900 XTX($1,300):两张卡 48GB、总价只比 4×3060 贵 $260,工程难度低一个量级;预算再高一点选 2× RTX 3090($2,200),带宽更高、CUDA 生态省心。
想要单卡省心:RTX A6000 48GB($2,800) 是单卡最便宜解(勉强装下);2× RTX 5090($3,998) 是「宽裕」档里总价最低的; Mac Studio M3 Ultra 96GB($5,299) 是唯一的单机能宽裕跑 70B 的桌面方案,代价是 124.9 tok/s 的理论速度上限——安静、省电,但不快。
继续研究
- 显存计算器 — 输入模型和显卡,精确算出显存需求与推荐量化档
- 本地 vs API 成本对比 — 算算本地跑多久能回本
- 2026 本地 LLM 显卡选购指南 — 按预算和模型规模的完整选购逻辑
常见问题
- 排名用的是全新价还是二手价?
- 价格取二手价优先:维护有二手参考价的卡(发布 ≥2 年)用 eBay 已售/挂牌口径的二手价;二手价字段为 0 的卡(RTX 5090、A100、H100 与三款 Apple 机型)用 MSRP 或市场参考价。二手价月度更新,当前数据核实日期为 2026-09-01。
- 每美元带宽最高,跑模型就一定最快吗?
- 不一定。前提是你的显存先装得下「模型权重 + KV 缓存」——装不下就得降量化、堆多卡,或者部分卸载到 CPU(速度断崖式下跌)。带宽只决定 tok/s 的上限,显存决定你能不能跑到那个上限。选卡时先看显存榜和 70B 门槛榜,再看带宽与速度榜。
- 为什么 Apple 统一内存按 75% 折算?
- Apple Silicon 的统一内存要和 macOS 系统及所有应用共享,GPU 实际可用上限约为总内存的 75%(推荐工作集口径)。所以 Mac mini M4 Pro 48GB 按 36GB、Mac Studio M3 Ultra 96GB 按 72GB 参与排名。独显则直接使用标称显存。
价格与规格数据核实日期:2026-09-01;二手价月度更新。所有排名由数据构建期实算,非人工填写。