GPUFits

2026 年本地大模型显卡选购指南:全预算覆盖

更新于 2026-08-04 · 核实于 2026-08-04

价格核实于 2026 年 8 月。二手市场变化很快,文中所有价格都请当作带日期的快照看待。

唯一重要的规则

显存容量第一,带宽第二,其他都往后站。 显卡在推理中的职责就是装下模型并快速读取。单用户生成场景下,计算核心数量几乎无关紧要。

预算分档

约 200 美元 —— RTX 3060 12GB(二手)

诚实的入门选择。12GB 能以 Q4–Q6 跑所有 7B–8B 模型还有富余,13B 级模型可以跑 Q4。360 GB/s 带宽意味着 8B 模型生成约 45 tok/s。刚开始玩 Ollama 的话这就够了——在摸清自己的使用习惯之前不要过度消费。

约 550 美元 —— RTX 4070 Ti Super 16GB(二手)/ RX 7900 XTX 24GB(二手,约 650 美元)

16GB 档能以 Q8 跑 13B 模型、Q4 跑 24B 模型。AMD 方案用差不多的钱给你 24GB 和 960 GB/s 带宽——但 llama.cpp 的 ROCm 支持是「能用」,不是「省心」。只有愿意折腾才买 AMD,显存性价比是实打实的。

约 1000 美元 —— RTX 3090 24GB(二手)—— 性价比之王

2026 年依然是标准答案。约 1000 美元的 24GB(eBay 2026 年 7 月成交记录 1010–1081 美元)能跑通 Qwen3-32B/Q4 以内的所有模型。两张(2000 美元)能以约 19 tok/s 跑 Llama-3.3-70B。代价:这是一张 6 年机龄、350W、零保修的卡。查卖家记录,到手烤机。

约 1100–1800 美元 —— RTX 4090 24GB(二手)

与 3090 同为 24GB,带宽高 8%,算力高得多。兼顾游戏或 SD/flux 绘图就值得。纯 LLM 推理的话,相对 3090 的溢价只买来约 10% 速度,仅此而已。

1999 美元 —— RTX 5090 32GB(全新)

最适合 LLM 的新卡,没有之一。32GB 终于让 32B 级模型在单卡上宽裕了,1792 GB/s 比 4090 提升 78% 带宽——token 生成速度近似线性提升。问题是货源:2026 年中市价在 2500–3200 美元。原价买到就值,加价 40% 很难说服自己。

2899–5299 美元 —— Mac Studio(M4 Max 64GB / M3 Ultra 96GB)

另一种哲学:巨大的统一内存、静音、约 100W。96GB 的 M3 Ultra 能装下 gpt-oss-120b 或 Q8 的 Llama-70B——任何单张消费级 N 卡都做不到。但带宽(819 GB/s)意味着 70B 模型生成只有约 10–15 tok/s,苹果税也是真的。注意:苹果 2026 年因 DRAM 缺货停产了 256GB/512GB 的 M3 Ultra 配置——96GB 已是上限,起售价也涨到了 5299 美元。

不要买

  • 8GB 显卡(4060、5060、3070):打游戏可以,跑现代 LLM 出生即过时。
  • H100/A100 自用:15000–30000 美元买来的数据中心功能你用不上,按小时租吧。
  • 500 美元以下的矿卡:省下的钱一次坏卡就全赔回去。

快速答案

我想跑……
7B–8B 模型二手 RTX 3060 12GB
13B–32B 模型二手 RTX 3090,或原价 RTX 5090
70B 模型2× 二手 3090,或 Mac Studio 96GB
120B MoE 模型Mac Studio 96GB,或 4× 3090
DeepSeek-R1 671B什么都别买——租云端 GPU

常见问题

2026 年性价比最高的本地 LLM 显卡是哪张?

二手 RTX 3090。约 1000 美元买 24GB 显存,Q4 下能跑所有 32B 以内的模型,两张就能跑 70B。论每美元买到的显存,没有对手。

RTX 5090 相比二手 4090 值得买吗?

如果能以 1999 美元原价买到就值:32GB 加比 4090 高 78% 的带宽,意味着 Qwen3-32B 从勉强变成宽裕,所有模型生成提速约 75%。但 2026 年市价普遍在 2500 美元以上,此时二手 4090 更理性。

跑 LLM 该买 Mac 还是 N 卡主机?

看重静音、低功耗和超大统一内存(跑巨型 MoE 模型)选 Mac;看重每美元速度和 CUDA 生态选 NVIDIA。完整对比见我们的 Mac vs GPU 指南。

来源