显卡库 / RTX A6000
RTX A6000 跑本地 LLM:能跑什么模型、速度多快
RTX A6000 是“一张卡跑 70B”的唯一标准答案:48GB ECC 显存、768 GB/s 带宽,Llama 3.3 70B Q4(约 47.4GB)勉强装下,Qwen3 32B 可勉强上 Q8_0(约 38.5GB)。二手约 $2,500-3,200(2026-08),显存单价是 24GB 卡的两倍以上——你买的不是带宽,是容量本身与确定性。
blower 单槽散热、300W TDP、支持 NVLink 桥接,天生为多卡工作站设计:两张就是 96GB,gpt-oss-120b Q3(约 60GB)都宽裕。缺点要认:Ampere 架构老了,768 GB/s 跑 70B 理论只有约 13 tok/s;ECC 显存对部分推理框架略有开销。适合需要大显存确定性、不接受多卡折腾、也不进 Apple 生态的专业用户;预算有限的同容量替代是双 3090,但要接受 PCIe 层拆分的复杂度与两倍的功耗。
规格
| 标称显存 | 48 GB |
| 可用显存(模型可用) | 48.0 GB |
| 显存带宽 | 768 GB/s |
| 类型 | 独显 |
| 发布年份 | 2020 |
| MSRP | $4,650 |
| 二手参考价 | $2,800 |
| TDP | 300 W |
性价比指标
每美元带宽
0.27 GB/s/$
每美元可用显存
0.017 GB/$
按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈90 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈36 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈35 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | FP16 | ≈20 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | Q8_0 | ≈23 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 宽裕 | Q8_0 | ≈20 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 宽裕 | Q8_0 | ≈19 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 宽裕 | Q8_0 | ≈18 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 宽裕 | Q8_0 | ≈164 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 宽裕 | Q8_0 | ≈17 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | FP16 | ≈80 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 勉强装下 | Q4_K_M | ≈13 tok/s | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RTX A6000 48GB 能跑 70B 吗?
- 能,勉强:Llama 3.3 70B Q4_K_M @8K 约 47.4GB,贴着装下,理论约 13 tok/s。想留余量或上 Q6/Q8,需要 A100 80GB 或双卡。
- A6000 和双 3090(48GB)怎么选?
- 同容量:双 3090 聚合带宽更高(936×2×0.85 ≈ 1591 vs 768 GB/s)、更便宜,但要折腾 PCIe 层拆分、功耗 700W;A6000 单卡安静、确定性强、可 NVLink。要省心选 A6000,要性价比选双 3090。
- 二手 A6000 合理价是多少?
- 2026-08 约 $2,500-3,200【估】。超过 $3,200 不如看 Mac Studio M4 Max 64GB($2,899 新机器带保修)或双 3090 方案。
相关指南
数据核实于 2026-09-01