GPUFits

GPU 性价比排行榜:本地跑大模型,哪张卡最值?

市面上大多数「显卡推荐」只是参数罗列。这个排行榜不一样:四个榜单全部由本站数据库在构建时实算, 覆盖 12 张消费级/专业级 GPU 与 Apple 统一内存机型,排名口径如下——

  • 价格:二手价优先;二手价字段为 0 的卡(RTX 5090、A100、H100、Apple 机型)用 MSRP 或市场参考价。二手价为 eBay 已售/挂牌口径,月度更新。
  • 速度:带宽 × 0.75 ÷ 每 token 权重字节数的理论估算,实际受框架/驱动/CPU 影响,误差约 ±30%。
  • 显存:Apple 统一内存按 75% 可用折算(需与系统和应用共享),独显取标称值。
  • 数据核实日期:2026-09-01。

榜一 · 每美元带宽

显存带宽决定 LLM 推理速度上限。公式:带宽(GB/s)÷ 价格。

# 显卡 带宽 价格 GB/s per $
1 RX 7900 XTX 960 GB/s $650 1.48
2 RTX 3060 12GB 360 GB/s $260较上月 +44% 1.38
3 RTX 5090 1,792 GB/s $1,999 0.90
4 RTX 4070 Ti Super 672 GB/s $760较上月 +38% 0.88
5 RTX 3090 936 GB/s $1,100较上月 +10% 0.85
6 RTX 4090 1,008 GB/s $2,400较上月 +118% 0.42
7 RTX A6000 768 GB/s $2,800 0.27
8 Mac Studio M4 Max (64GB) 546 GB/s $2,899 0.19
9 Mac Studio M3 Ultra (96GB) 819 GB/s $5,299 0.15
10 Mac mini M4 Pro (48GB) 273 GB/s $1,799 0.15
11 A100 80GB 2,039 GB/s $15,000 0.14
12 H100 80GB 3,350 GB/s $30,000 0.11

RX 7900 XTX 以约 $650 的二手价拿下第一,每美元 1.48 GB/s,是带宽维度的甜点。 RTX 3060 12GB 虽然在 DRAM 涨价潮中二手价较 7 月上涨约 40%(从 $170-220 涨到 $250-275, NVIDIA 甚至以 $339 重新上架零售),仍以 1.39 稳居第二——涨价都撼动不了它的性价比。

RTX 5090 按 $1,999 MSRP 排第三,但注意:它二级市场实际成交已达 2.1× MSRP(新卡 $4,288-4,381),按市价算会跌出前列——能以原价买到才算真香。 垫底的 A100/H100 说明一件事:数据中心卡的带宽单价是消费卡的 10 倍,纯跑推理的个人玩家不必仰望。

榜二 · 每美元显存

显存决定你能装下多大的模型。公式:可用显存 ÷ 价格(Apple 统一内存按 75% 折算)。

# 显卡 可用显存 价格 GB per $100
1 RTX 3060 12GB 12.0 GB $260较上月 +44% 4.62
2 RX 7900 XTX 24.0 GB $650 3.69
3 RTX 3090 24.0 GB $1,100较上月 +10% 2.18
4 RTX 4070 Ti Super 16.0 GB $760较上月 +38% 2.11
5 Mac mini M4 Pro (48GB)(×0.75) 36.0 GB $1,799 2.00
6 RTX A6000 48.0 GB $2,800 1.71
7 Mac Studio M4 Max (64GB)(×0.75) 48.0 GB $2,899 1.66
8 RTX 5090 32.0 GB $1,999 1.60
9 Mac Studio M3 Ultra (96GB)(×0.75) 72.0 GB $5,299 1.36
10 RTX 4090 24.0 GB $2,400较上月 +118% 1.00
11 A100 80GB 80.0 GB $15,000 0.53
12 H100 80GB 80.0 GB $30,000 0.27

RTX 3060 12GB 每百美元 4.6GB 显存,断层式第一,这也是它常年霸占入门推荐的原因。 RX 7900 XTX 以 3.7GB 居次;原价 $999 的 24GB 卡二手只卖 $650,AMD 在显存维度一直是价格屠夫。

RTX 3090 尽管 24GB 显存溢价持续(二手 $1,095-1,181),仍以 2.2GB/$100 排第三,是多卡跑 70B 的性价比主力。 折算后的 Mac mini M4 Pro 48GB(可用 36GB)挤进前五——想要安静、低功耗地装下 30B 级模型,它是 $1,799 价位唯一解。

榜三 · 8B 模型每美元速度

以 Llama 3.1 8B Q4_K_M 为基准(每 token 读取 4.9GB 权重),公式:理论 tok/s ÷ 价格。理论估算,误差 ±30%。

# 显卡 估算速度 价格 tok/s per $100
1 RX 7900 XTX 约 146 tok/s $650 22.5
2 RTX 3060 12GB 约 55 tok/s $260较上月 +44% 21.1
3 RTX 5090 约 273 tok/s $1,999 13.7
4 RTX 4070 Ti Super 约 102 tok/s $760较上月 +38% 13.5
5 RTX 3090 约 143 tok/s $1,100较上月 +10% 13.0
6 RTX 4090 约 154 tok/s $2,400较上月 +118% 6.4
7 RTX A6000 约 117 tok/s $2,800 4.2
8 Mac Studio M4 Max (64GB) 约 83 tok/s $2,899 2.9
9 Mac Studio M3 Ultra (96GB) 约 125 tok/s $5,299 2.4
10 Mac mini M4 Pro (48GB) 约 42 tok/s $1,799 2.3
11 A100 80GB 约 311 tok/s $15,000 2.1
12 H100 80GB 约 511 tok/s $30,000 1.7

跑 8B 小模型,RX 7900 XTXRTX 3060 12GB 的每美元速度几乎打平(22.5 vs 21.1 tok/s/$100), 分别是 $650 与 $260 预算档的甜点——前者速度接近三倍,后者门槛只有零头。RTX 5090 以 13.7 排第三,绝对速度 273 tok/s 是全场消费卡最快,但单价摊薄了优势。

反面教材是 RTX 4090:已停产,二手价锚定 5090 一路涨到 $2,350-2,500,每美元速度只有 3060 的三分之一。只为 8B 模型买 4090,每一分钱都在为停产溢价买单。

榜四 · 70B 大模型最低门槛

舒适运行 Llama 3.3 70B Q4_K_M @ 8K 上下文(总需求 47.4GB = 权重 43.2 + KV 2.7 + 开销 1.5)的最便宜方案,按总价升序。单卡装不下的标注所需卡数,总价 = 单价 × 卡数(未计主板/电源/散热成本);统一内存机型不参与多机堆叠。

# 方案 卡数 总价 余量判定
1 RTX 3060 12GB需 4 卡 4 $1,040较上月 +44% 勉强装下
2 RX 7900 XTX需 2 卡 2 $1,300 勉强装下
3 RTX 3090需 2 卡 2 $2,200较上月 +10% 勉强装下
4 RTX 4070 Ti Super需 3 卡 3 $2,280较上月 +38% 勉强装下
5 RTX A6000 1 $2,800 勉强装下
6 Mac Studio M4 Max (64GB) 1 $2,899 勉强装下
7 RTX 5090需 2 卡 2 $3,998 宽裕
8 RTX 4090需 2 卡 2 $4,800较上月 +118% 勉强装下
9 Mac Studio M3 Ultra (96GB) 1 $5,299 宽裕
10 A100 80GB 1 $15,000 宽裕
11 H100 80GB 1 $30,000 宽裕

最便宜的 70B 入场券是 4× RTX 3060 12GB($1,040)——但只是勉强装下,且 4 卡的供电、散热和主板插槽都是隐性成本。 真正的甜点是 2× RX 7900 XTX($1,300):两张卡 48GB、总价只比 4×3060 贵 $260,工程难度低一个量级;预算再高一点选 2× RTX 3090($2,200),带宽更高、CUDA 生态省心。

想要单卡省心:RTX A6000 48GB($2,800) 是单卡最便宜解(勉强装下);2× RTX 5090($3,998) 是「宽裕」档里总价最低的; Mac Studio M3 Ultra 96GB($5,299) 是唯一的单机能宽裕跑 70B 的桌面方案,代价是 124.9 tok/s 的理论速度上限——安静、省电,但不快。

继续研究

常见问题

排名用的是全新价还是二手价?
价格取二手价优先:维护有二手参考价的卡(发布 ≥2 年)用 eBay 已售/挂牌口径的二手价;二手价字段为 0 的卡(RTX 5090、A100、H100 与三款 Apple 机型)用 MSRP 或市场参考价。二手价月度更新,当前数据核实日期为 2026-09-01。
每美元带宽最高,跑模型就一定最快吗?
不一定。前提是你的显存先装得下「模型权重 + KV 缓存」——装不下就得降量化、堆多卡,或者部分卸载到 CPU(速度断崖式下跌)。带宽只决定 tok/s 的上限,显存决定你能不能跑到那个上限。选卡时先看显存榜和 70B 门槛榜,再看带宽与速度榜。
为什么 Apple 统一内存按 75% 折算?
Apple Silicon 的统一内存要和 macOS 系统及所有应用共享,GPU 实际可用上限约为总内存的 75%(推荐工作集口径)。所以 Mac mini M4 Pro 48GB 按 36GB、Mac Studio M3 Ultra 96GB 按 72GB 参与排名。独显则直接使用标称显存。

价格与规格数据核实日期:2026-09-01;二手价月度更新。所有排名由数据构建期实算,非人工填写。