GPUFits

2026 年本地大模型显卡选购指南:全预算覆盖

更新于 2026-09-10 · 核实于 2026-08-04

价格核实于 2026 年 9 月(本站显卡数据库快照)。二手市场变化很快——仅 2026 年夏天的 DRAM 涨价潮,两个月内就把 3060 二手价推高了约 40%——文中所有价格都请当作带日期的快照看待。

唯一重要的规则

显存容量第一,带宽第二,其他都往后站。

原因藏在推理的工作方式里:每生成一个 token,显卡都要把模型权重完整读一遍。单用户聊天时 batch 很小,计算核心大量闲置,瓶颈几乎全在「每秒能从显存读出多少 GB」。所以:

  • 显存装不下模型 → 直接出局,或者掉进 CPU 卸载的速度悬崖(后文有具体数字)。
  • 装得下之后,生成速度 ≈ 显存带宽 ÷ 每 token 要读的权重量。CUDA 核心数、Tensor 核心代数,对 tok/s 的影响都在误差范围内。

推论:比较两张卡时,先比显存,再比带宽,然后就可以结束比较了。 4090 的算力比 3090 高一倍多,但同为 24GB、带宽只差 8%,LLM 推理就只快 8% 左右——多花的钱买的是游戏和绘图性能,不是 token。

第一步:算清你的模型要多少显存

买卡之前先算数。总需求 = 权重 + KV 缓存 + 运行时开销(约 1.5GB)。

权重由量化档位决定。按实测 GGUF 文件换算(本站数据,含 embedding 与元数据开销,略高于理论比特率):

量化每 10 亿参数权重
FP162.00 GB
Q8_01.06 GB
Q6_K0.82 GB
Q4_K_M(社区默认)0.61 GB
Q3_K_M0.50 GB

KV 缓存随上下文线性增长,是最常被忽略的一项。以 Qwen3-32B 为例:8K 上下文约 2.1GB,32K 拉满就是 8.6GB——比很多相邻价位显卡的显存差额还大。把 KV 量化到 q8 可以减半,是长上下文场景最划算的省显存手段。

代入完整公式(Q4_K_M、8K 上下文、fp16 KV):

模型权重KV 缓存总需求24GB 卡判定
Llama-3.1-8B4.9 GB1.1 GB≈7.5 GB宽裕
Phi-4(14.7B)9.0 GB1.7 GB≈12.2 GB宽裕
Mistral-Small-24B14.7 GB1.3 GB≈17.5 GB宽裕
Qwen3-32B20.1 GB2.1 GB≈23.7 GB紧张(贴顶)
Llama-3.3-70B43.2 GB2.7 GB≈47.4 GB单卡没戏,2×24GB 贴顶

两个容易踩的坑:

  • 上下文拉满会推翻结论。 Qwen3-32B 在 24GB 卡上,8K 上下文是「贴顶」,32K 直接不可行;32GB 的 5090 才能让它 8K 宽裕、32K 也装得下。
  • MoE 模型省速度不省显存。 Qwen3-30B-A3B 每个 token 只激活 3.3B 参数,但 30.5B 总参数必须全部装下——它依然需要 24GB 级显卡。

不想手算的话,直接用显存检查器选模型和显卡看判定,KV 缓存和上下文都替你算好了。

第二步:速度怎么估

理论生成速度 ≈ 带宽 × 0.75 ÷ 每 token 权重量。0.75 是经验效率系数,实际受框架、驱动、CPU 影响,误差 ±30%——只适合横向对比档位,别当精确预测。仍以 Q4_K_M 为例:

显卡带宽8B 模型32B 模型
RTX 3060 12GB360 GB/s≈55 tok/s装不下
RTX 3090 24GB936 GB/s≈143 tok/s≈35 tok/s
RTX 4090 24GB1,008 GB/s≈154 tok/s≈38 tok/s
RTX 5090 32GB1,792 GB/s≈273 tok/s≈67 tok/s

体验参照:20 tok/s 以上聊天基本无感,10 tok/s 是正常阅读速度,5 tok/s 以下开始难受。

MoE 的速度红利在这里兑现。 同一张 3090,Qwen3-30B-A3B 每 token 只读 3.3B 激活参数,理论速度冲到约 350 tok/s——是 32B 稠密模型的 10 倍。这是 2026 年 MoE 模型统治本地部署的根本原因。

显存装不下时的速度悬崖。 把 70B Q4 的部分层卸载到 DDR5 内存(约 80 GB/s),公式里的带宽直接取 min(936, 80):理论速度 ≈1.4 tok/s。从「装得下」到「装不下」,速度不是打八折,是掉一个数量级还多。这就是为什么容量规则排在第一位。

预算分档(2026 年 9 月价格)

约 260 美元 —— RTX 3060 12GB(二手)

诚实的入门选择。12GB 宽裕装下所有 7B–8B 模型的 Q4–Q6,14B 级(Phi-4)能跑 Q4;360 GB/s 带宽下 8B 模型约 55 tok/s,日常聊天够用。注意:DRAM 涨价潮已把它从 7 月的 170–220 美元推到 250–275 美元,NVIDIA 今年还以 339 美元重新上架了新卡——二手喊价超过 280 美元就不如买新的。适合刚上手 Ollama、还没摸清自己用法的人:在知道自己是「8B 够用」还是「非 32B 不可」之前,不要过度消费。

约 650–800 美元 —— RX 7900 XTX 24GB(二手,约 650)/ RTX 4070 Ti Super 16GB(二手,约 760)

AMD 方案是这个价位的显存黑马:约 650 美元买 24GB + 960 GB/s,纸面数据贴着 3090。代价是 ROCm 在 llama.cpp 下「能用,不省心」,驱动和框架的坑要自己踩。愿意折腾,这是 24GB 容量最便宜的路;不愿意,加钱上 3090。

N 卡这边的 4070 Ti Super 只有 16GB:14B Q4 宽裕,gpt-oss-20b 贴顶(总需求约 14.7GB),24B 及以上不用想。受显存涨价推动,二手已涨到 720–800 美元,性价比被 7900 XTX 和 3090 两头挤压,只推荐给「功耗敏感 + 只跑 14B 以内」的人(285W,比 3090 省电不少)。

约 1100 美元 —— RTX 3090 24GB(二手)—— 性价比之王

2026 年 9 月依然是标准答案。约 1100 美元的 24GB 通吃 Qwen3-32B/Q4 以内的所有模型(含 30B 级 MoE),936 GB/s 带宽下 32B 生成约 35 tok/s。两张(约 2200 美元)贴顶跑 Llama-3.3-70B,按多卡 0.85 带宽损耗建模约 19 tok/s,细节见多卡指南。

代价要写清楚:2020 年发布的卡,350W,零保修,GDDR6X 显存发热出名。验机清单见下文。

约 1800 美元 —— Mac mini M4 Pro 48GB(全新)

被低估的静音路线。统一内存按 75% 可用折算约 36GB:Qwen3-32B/Q4 宽裕装下,但 273 GB/s 带宽意味着 32B 只有约 10 tok/s、8B 约 40 tok/s。适合「要装得下大模型、可以接受慢、讨厌风扇声和电费」的人——整机约 50W、全新带保,是二手 N 卡给不了的组合。

约 2400 美元 —— RTX 4090 24GB(二手)

已停产,价格锚定 5090 而非发售价,近三个月又涨了约 10%。与 3090 同为 24GB,带宽只高 8%——纯 LLM 推理,相对 3090 的约 1300 美元溢价只买来约 10% 速度。除非你还要打游戏或跑 SD/flux 绘图,否则这笔钱没有道理。

约 2800 美元 —— RTX A6000 48GB(二手)

单卡 48GB 的独苗:70B Q4(总需求约 47.4GB)贴顶装下,不用折腾多卡、电源和散热堆叠。但带宽只有 768 GB/s,70B 生成约 13 tok/s——比 2×3090 慢,还更贵。买它的理由是单槽涡轮散热、ECC 显存和免折腾,不是性价比。

1999 美元原价(市价约 3600+)—— RTX 5090 32GB(全新)

最适合 LLM 的新卡,没有之一。32GB 让 32B 级模型在单卡上宽裕——Qwen3-32B 拉满 32K 上下文也装得下;1792 GB/s 带宽比 4090 高 78%,生成速度近似线性兑现:32B 约 67 tok/s,8B 约 273 tok/s。

但 2026 年的现实是货源:二级市场新卡 4300 美元上下、二手 3600 美元起,约 2.1 倍于发售价。原价买到就值;两倍价买一张 32GB 的卡,不如把同样的钱拆成两张 3090 换 48GB。

2899–5299 美元 —— Mac Studio(M4 Max 64GB / M3 Ultra 96GB)

另一种哲学:巨大的统一内存、静音、约 100W。按 75% 可用折算,96GB 的 M3 Ultra 约有 72GB 可用——装得下 gpt-oss-120b(原生 MXFP4 权重约 62GB)这种任何单张消费级 N 卡都装不下的模型。代价是带宽:819 GB/s 跑 70B 稠密模型约 14 tok/s,聊天够用,跑 Agent 难受。MoE 是例外:gpt-oss-120b 每 token 只读 5.1B 激活参数,理论速度能到 200 tok/s 量级——大容量 MoE 才是 Mac 的主场。

注意:苹果 2026 年因 DRAM 缺货停产了 256GB/512GB 的 M3 Ultra 配置,96GB 已是上限,起售价也从 3999 美元涨到 5299 美元。

二手卡验机清单(3090/4090 必做)

  • 查卖家历史与评价,只买有真实成交记录的账号;走平台担保交易,保留聊天记录。
  • 到手先满载 30 分钟以上(跑个 32B 模型就是现成的压力测试),盯显存温度——3090 的 GDDR6X 背面显存是知名热点,持续破百说明导热垫该换了,这笔成本要算进总价。
  • 跑一遍显存压力测试,花屏、报错、掉驱动直接退货。
  • 问清是否拆修过、是否挖过矿。矿卡不是不能买,但价格要再折一截(见「不要买」)。
  • 多卡方案额外确认:电源留足余量(两张 350W 的卡要品质合格的 1200W+),主板有物理 x16 槽位,机箱风道压得住。

常见误区

  • 「算力越强推理越快」:错。单用户生成是带宽瓶颈,4090 翻倍的算力在 LLM 上只兑现为带宽差的那 8%。
  • 「按最大上下文买卡」:KV 缓存随上下文线性膨胀。先用 8K 判定选卡,确认自己真的需要 32K+ 长上下文,再为它付显存溢价。
  • 「MoE 模型显存需求小」:省的是每 token 读取量(速度),不是容量。30B 的 MoE 依然要 24GB 显卡。
  • 「双卡速度翻倍」:跨卡同步有损耗,按 ×0.85 建模,2×3090 等效约 1590 GB/s,不是 1872。
  • 「96GB 的 Mac 能装 96GB 模型」:macOS 给 GPU 的内存上限约为物理内存的 75%,96GB 实际可用约 72GB。
  • 「差 2GB 就 CPU 卸载凑合」:卸载层的读取走约 80 GB/s 的系统内存,速度掉一个数量级。跑一次性评估可以,日常聊天不值得。

不要买

  • 8GB 显卡(4060、5060、3070):打游戏可以,跑现代 LLM 出生即过时——一个 8B 模型的 Q4 加 KV 缓存就要约 7.5GB。
  • H100/A100 自用:15000–30000 美元买来的是 NVLink、ECC、虚拟化这些数据中心功能;单用户推理一样受带宽公式约束,H100 的 3.35 TB/s 也不会让聊天体验好 30 倍。需要时按小时租。
  • 500 美元以下的矿卡:2026 年这个价位连 16GB 都买不到,省下的钱一次坏卡就全赔回去。

快速答案

我想跑……
7B–8B 模型二手 RTX 3060 12GB
14B–24B 模型二手 3090;愿意折腾就 RX 7900 XTX
32B 模型二手 3090(贴顶);原价能买到的 5090(宽裕)
70B 模型2× 二手 3090,或 Mac Studio 96GB
120B MoE 模型Mac Studio 96GB,或 4× 3090
DeepSeek-R1 671B什么都别买——租云端 GPU

下一步

锁定想跑的模型后,用显存检查器跑一遍具体判定(含 KV 缓存与上下文),再用成本对比器算算整机功耗差——350W 的二手卡和 100W 的 Mac 常年开机,电费差会慢慢改变性价比结论。

常见问题

2026 年性价比最高的本地 LLM 显卡是哪张?

二手 RTX 3090。约 1100 美元买 24GB 显存,Q4 下能跑所有 32B 以内的模型,两张就能跑 70B。论每美元买到的显存,没有对手。

RTX 5090 相比二手 3090 值得买吗?

能以 1999 美元原价买到就值:32GB 加 1792 GB/s 带宽,Qwen3-32B 从贴顶变宽裕,32B 生成约 67 tok/s。但 2026 年 9 月市价约 2.1 倍于原价(二手 3600 美元起),这个价格不如把钱拆成两张 3090,换来 48GB。

16GB 显卡 2026 年还够用吗?

够用来玩 14B 级模型:Phi-4 的 Q4 加 8K 上下文约 12GB,很宽裕;gpt-oss-20b 约 14.7GB,贴顶。但 24B 及以上不用考虑,32B 更是连门都没有。想跑 32B 就一步到位 24GB。

二手 3090 是 6 年前的卡了,风险大吗?

真实存在:350W 功耗、无保修、GDDR6X 显存发热出名。对策是验机——到手满载 30 分钟盯显存温度,跑显存压力测试,查卖家历史。做好这些,它依然是 2026 年每美元显存的最优解。

跑 LLM 该买 Mac 还是 N 卡主机?

看重静音、低功耗和超大统一内存(跑巨型 MoE 模型)选 Mac;看重每美元速度和 CUDA 生态选 NVIDIA。完整对比见我们的 Mac vs GPU 指南。

来源