2026 年本地大模型显卡选购指南:全预算覆盖
更新于 2026-09-10 · 核实于 2026-08-04
价格核实于 2026 年 9 月(本站显卡数据库快照)。二手市场变化很快——仅 2026 年夏天的 DRAM 涨价潮,两个月内就把 3060 二手价推高了约 40%——文中所有价格都请当作带日期的快照看待。
唯一重要的规则
显存容量第一,带宽第二,其他都往后站。
原因藏在推理的工作方式里:每生成一个 token,显卡都要把模型权重完整读一遍。单用户聊天时 batch 很小,计算核心大量闲置,瓶颈几乎全在「每秒能从显存读出多少 GB」。所以:
- 显存装不下模型 → 直接出局,或者掉进 CPU 卸载的速度悬崖(后文有具体数字)。
- 装得下之后,生成速度 ≈ 显存带宽 ÷ 每 token 要读的权重量。CUDA 核心数、Tensor 核心代数,对 tok/s 的影响都在误差范围内。
推论:比较两张卡时,先比显存,再比带宽,然后就可以结束比较了。 4090 的算力比 3090 高一倍多,但同为 24GB、带宽只差 8%,LLM 推理就只快 8% 左右——多花的钱买的是游戏和绘图性能,不是 token。
第一步:算清你的模型要多少显存
买卡之前先算数。总需求 = 权重 + KV 缓存 + 运行时开销(约 1.5GB)。
权重由量化档位决定。按实测 GGUF 文件换算(本站数据,含 embedding 与元数据开销,略高于理论比特率):
| 量化 | 每 10 亿参数权重 |
|---|---|
| FP16 | 2.00 GB |
| Q8_0 | 1.06 GB |
| Q6_K | 0.82 GB |
| Q4_K_M(社区默认) | 0.61 GB |
| Q3_K_M | 0.50 GB |
KV 缓存随上下文线性增长,是最常被忽略的一项。以 Qwen3-32B 为例:8K 上下文约 2.1GB,32K 拉满就是 8.6GB——比很多相邻价位显卡的显存差额还大。把 KV 量化到 q8 可以减半,是长上下文场景最划算的省显存手段。
代入完整公式(Q4_K_M、8K 上下文、fp16 KV):
| 模型 | 权重 | KV 缓存 | 总需求 | 24GB 卡判定 |
|---|---|---|---|---|
| Llama-3.1-8B | 4.9 GB | 1.1 GB | ≈7.5 GB | 宽裕 |
| Phi-4(14.7B) | 9.0 GB | 1.7 GB | ≈12.2 GB | 宽裕 |
| Mistral-Small-24B | 14.7 GB | 1.3 GB | ≈17.5 GB | 宽裕 |
| Qwen3-32B | 20.1 GB | 2.1 GB | ≈23.7 GB | 紧张(贴顶) |
| Llama-3.3-70B | 43.2 GB | 2.7 GB | ≈47.4 GB | 单卡没戏,2×24GB 贴顶 |
两个容易踩的坑:
- 上下文拉满会推翻结论。 Qwen3-32B 在 24GB 卡上,8K 上下文是「贴顶」,32K 直接不可行;32GB 的 5090 才能让它 8K 宽裕、32K 也装得下。
- MoE 模型省速度不省显存。 Qwen3-30B-A3B 每个 token 只激活 3.3B 参数,但 30.5B 总参数必须全部装下——它依然需要 24GB 级显卡。
不想手算的话,直接用显存检查器选模型和显卡看判定,KV 缓存和上下文都替你算好了。
第二步:速度怎么估
理论生成速度 ≈ 带宽 × 0.75 ÷ 每 token 权重量。0.75 是经验效率系数,实际受框架、驱动、CPU 影响,误差 ±30%——只适合横向对比档位,别当精确预测。仍以 Q4_K_M 为例:
| 显卡 | 带宽 | 8B 模型 | 32B 模型 |
|---|---|---|---|
| RTX 3060 12GB | 360 GB/s | ≈55 tok/s | 装不下 |
| RTX 3090 24GB | 936 GB/s | ≈143 tok/s | ≈35 tok/s |
| RTX 4090 24GB | 1,008 GB/s | ≈154 tok/s | ≈38 tok/s |
| RTX 5090 32GB | 1,792 GB/s | ≈273 tok/s | ≈67 tok/s |
体验参照:20 tok/s 以上聊天基本无感,10 tok/s 是正常阅读速度,5 tok/s 以下开始难受。
MoE 的速度红利在这里兑现。 同一张 3090,Qwen3-30B-A3B 每 token 只读 3.3B 激活参数,理论速度冲到约 350 tok/s——是 32B 稠密模型的 10 倍。这是 2026 年 MoE 模型统治本地部署的根本原因。
显存装不下时的速度悬崖。 把 70B Q4 的部分层卸载到 DDR5 内存(约 80 GB/s),公式里的带宽直接取 min(936, 80):理论速度 ≈1.4 tok/s。从「装得下」到「装不下」,速度不是打八折,是掉一个数量级还多。这就是为什么容量规则排在第一位。
预算分档(2026 年 9 月价格)
约 260 美元 —— RTX 3060 12GB(二手)
诚实的入门选择。12GB 宽裕装下所有 7B–8B 模型的 Q4–Q6,14B 级(Phi-4)能跑 Q4;360 GB/s 带宽下 8B 模型约 55 tok/s,日常聊天够用。注意:DRAM 涨价潮已把它从 7 月的 170–220 美元推到 250–275 美元,NVIDIA 今年还以 339 美元重新上架了新卡——二手喊价超过 280 美元就不如买新的。适合刚上手 Ollama、还没摸清自己用法的人:在知道自己是「8B 够用」还是「非 32B 不可」之前,不要过度消费。
约 650–800 美元 —— RX 7900 XTX 24GB(二手,约 650)/ RTX 4070 Ti Super 16GB(二手,约 760)
AMD 方案是这个价位的显存黑马:约 650 美元买 24GB + 960 GB/s,纸面数据贴着 3090。代价是 ROCm 在 llama.cpp 下「能用,不省心」,驱动和框架的坑要自己踩。愿意折腾,这是 24GB 容量最便宜的路;不愿意,加钱上 3090。
N 卡这边的 4070 Ti Super 只有 16GB:14B Q4 宽裕,gpt-oss-20b 贴顶(总需求约 14.7GB),24B 及以上不用想。受显存涨价推动,二手已涨到 720–800 美元,性价比被 7900 XTX 和 3090 两头挤压,只推荐给「功耗敏感 + 只跑 14B 以内」的人(285W,比 3090 省电不少)。
约 1100 美元 —— RTX 3090 24GB(二手)—— 性价比之王
2026 年 9 月依然是标准答案。约 1100 美元的 24GB 通吃 Qwen3-32B/Q4 以内的所有模型(含 30B 级 MoE),936 GB/s 带宽下 32B 生成约 35 tok/s。两张(约 2200 美元)贴顶跑 Llama-3.3-70B,按多卡 0.85 带宽损耗建模约 19 tok/s,细节见多卡指南。
代价要写清楚:2020 年发布的卡,350W,零保修,GDDR6X 显存发热出名。验机清单见下文。
约 1800 美元 —— Mac mini M4 Pro 48GB(全新)
被低估的静音路线。统一内存按 75% 可用折算约 36GB:Qwen3-32B/Q4 宽裕装下,但 273 GB/s 带宽意味着 32B 只有约 10 tok/s、8B 约 40 tok/s。适合「要装得下大模型、可以接受慢、讨厌风扇声和电费」的人——整机约 50W、全新带保,是二手 N 卡给不了的组合。
约 2400 美元 —— RTX 4090 24GB(二手)
已停产,价格锚定 5090 而非发售价,近三个月又涨了约 10%。与 3090 同为 24GB,带宽只高 8%——纯 LLM 推理,相对 3090 的约 1300 美元溢价只买来约 10% 速度。除非你还要打游戏或跑 SD/flux 绘图,否则这笔钱没有道理。
约 2800 美元 —— RTX A6000 48GB(二手)
单卡 48GB 的独苗:70B Q4(总需求约 47.4GB)贴顶装下,不用折腾多卡、电源和散热堆叠。但带宽只有 768 GB/s,70B 生成约 13 tok/s——比 2×3090 慢,还更贵。买它的理由是单槽涡轮散热、ECC 显存和免折腾,不是性价比。
1999 美元原价(市价约 3600+)—— RTX 5090 32GB(全新)
最适合 LLM 的新卡,没有之一。32GB 让 32B 级模型在单卡上宽裕——Qwen3-32B 拉满 32K 上下文也装得下;1792 GB/s 带宽比 4090 高 78%,生成速度近似线性兑现:32B 约 67 tok/s,8B 约 273 tok/s。
但 2026 年的现实是货源:二级市场新卡 4300 美元上下、二手 3600 美元起,约 2.1 倍于发售价。原价买到就值;两倍价买一张 32GB 的卡,不如把同样的钱拆成两张 3090 换 48GB。
2899–5299 美元 —— Mac Studio(M4 Max 64GB / M3 Ultra 96GB)
另一种哲学:巨大的统一内存、静音、约 100W。按 75% 可用折算,96GB 的 M3 Ultra 约有 72GB 可用——装得下 gpt-oss-120b(原生 MXFP4 权重约 62GB)这种任何单张消费级 N 卡都装不下的模型。代价是带宽:819 GB/s 跑 70B 稠密模型约 14 tok/s,聊天够用,跑 Agent 难受。MoE 是例外:gpt-oss-120b 每 token 只读 5.1B 激活参数,理论速度能到 200 tok/s 量级——大容量 MoE 才是 Mac 的主场。
注意:苹果 2026 年因 DRAM 缺货停产了 256GB/512GB 的 M3 Ultra 配置,96GB 已是上限,起售价也从 3999 美元涨到 5299 美元。
二手卡验机清单(3090/4090 必做)
- 查卖家历史与评价,只买有真实成交记录的账号;走平台担保交易,保留聊天记录。
- 到手先满载 30 分钟以上(跑个 32B 模型就是现成的压力测试),盯显存温度——3090 的 GDDR6X 背面显存是知名热点,持续破百说明导热垫该换了,这笔成本要算进总价。
- 跑一遍显存压力测试,花屏、报错、掉驱动直接退货。
- 问清是否拆修过、是否挖过矿。矿卡不是不能买,但价格要再折一截(见「不要买」)。
- 多卡方案额外确认:电源留足余量(两张 350W 的卡要品质合格的 1200W+),主板有物理 x16 槽位,机箱风道压得住。
常见误区
- 「算力越强推理越快」:错。单用户生成是带宽瓶颈,4090 翻倍的算力在 LLM 上只兑现为带宽差的那 8%。
- 「按最大上下文买卡」:KV 缓存随上下文线性膨胀。先用 8K 判定选卡,确认自己真的需要 32K+ 长上下文,再为它付显存溢价。
- 「MoE 模型显存需求小」:省的是每 token 读取量(速度),不是容量。30B 的 MoE 依然要 24GB 显卡。
- 「双卡速度翻倍」:跨卡同步有损耗,按 ×0.85 建模,2×3090 等效约 1590 GB/s,不是 1872。
- 「96GB 的 Mac 能装 96GB 模型」:macOS 给 GPU 的内存上限约为物理内存的 75%,96GB 实际可用约 72GB。
- 「差 2GB 就 CPU 卸载凑合」:卸载层的读取走约 80 GB/s 的系统内存,速度掉一个数量级。跑一次性评估可以,日常聊天不值得。
不要买
- 8GB 显卡(4060、5060、3070):打游戏可以,跑现代 LLM 出生即过时——一个 8B 模型的 Q4 加 KV 缓存就要约 7.5GB。
- H100/A100 自用:15000–30000 美元买来的是 NVLink、ECC、虚拟化这些数据中心功能;单用户推理一样受带宽公式约束,H100 的 3.35 TB/s 也不会让聊天体验好 30 倍。需要时按小时租。
- 500 美元以下的矿卡:2026 年这个价位连 16GB 都买不到,省下的钱一次坏卡就全赔回去。
快速答案
| 我想跑…… | 买 |
|---|---|
| 7B–8B 模型 | 二手 RTX 3060 12GB |
| 14B–24B 模型 | 二手 3090;愿意折腾就 RX 7900 XTX |
| 32B 模型 | 二手 3090(贴顶);原价能买到的 5090(宽裕) |
| 70B 模型 | 2× 二手 3090,或 Mac Studio 96GB |
| 120B MoE 模型 | Mac Studio 96GB,或 4× 3090 |
| DeepSeek-R1 671B | 什么都别买——租云端 GPU |
下一步
锁定想跑的模型后,用显存检查器跑一遍具体判定(含 KV 缓存与上下文),再用成本对比器算算整机功耗差——350W 的二手卡和 100W 的 Mac 常年开机,电费差会慢慢改变性价比结论。
常见问题
2026 年性价比最高的本地 LLM 显卡是哪张?
二手 RTX 3090。约 1100 美元买 24GB 显存,Q4 下能跑所有 32B 以内的模型,两张就能跑 70B。论每美元买到的显存,没有对手。
RTX 5090 相比二手 3090 值得买吗?
能以 1999 美元原价买到就值:32GB 加 1792 GB/s 带宽,Qwen3-32B 从贴顶变宽裕,32B 生成约 67 tok/s。但 2026 年 9 月市价约 2.1 倍于原价(二手 3600 美元起),这个价格不如把钱拆成两张 3090,换来 48GB。
16GB 显卡 2026 年还够用吗?
够用来玩 14B 级模型:Phi-4 的 Q4 加 8K 上下文约 12GB,很宽裕;gpt-oss-20b 约 14.7GB,贴顶。但 24B 及以上不用考虑,32B 更是连门都没有。想跑 32B 就一步到位 24GB。
二手 3090 是 6 年前的卡了,风险大吗?
真实存在:350W 功耗、无保修、GDDR6X 显存发热出名。对策是验机——到手满载 30 分钟盯显存温度,跑显存压力测试,查卖家历史。做好这些,它依然是 2026 年每美元显存的最优解。
跑 LLM 该买 Mac 还是 N 卡主机?
看重静音、低功耗和超大统一内存(跑巨型 MoE 模型)选 Mac;看重每美元速度和 CUDA 生态选 NVIDIA。完整对比见我们的 Mac vs GPU 指南。