GPUFits

显卡库 / RTX A6000

RTX A6000 跑本地 LLM:能跑什么模型、速度多快

RTX A6000 是“一张卡跑 70B”的唯一标准答案:48GB ECC 显存、768 GB/s 带宽,Llama 3.3 70B Q4(约 47.4GB)勉强装下,Qwen3 32B 可勉强上 Q8_0(约 38.5GB)。二手约 $2,500-3,200(2026-08),显存单价是 24GB 卡的两倍以上——你买的不是带宽,是容量本身与确定性。

blower 单槽散热、300W TDP、支持 NVLink 桥接,天生为多卡工作站设计:两张就是 96GB,gpt-oss-120b Q3(约 60GB)都宽裕。缺点要认:Ampere 架构老了,768 GB/s 跑 70B 理论只有约 13 tok/s;ECC 显存对部分推理框架略有开销。适合需要大显存确定性、不接受多卡折腾、也不进 Apple 生态的专业用户;预算有限的同容量替代是双 3090,但要接受 PCIe 层拆分的复杂度与两倍的功耗。

规格

标称显存48 GB
可用显存(模型可用)48.0 GB
显存带宽768 GB/s
类型独显
发布年份2020
MSRP$4,650
二手参考价$2,800
TDP300 W

性价比指标

每美元带宽
0.27 GB/s/$
每美元可用显存
0.017 GB/$

按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈90 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈36 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈35 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈20 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 Q8_0 ≈23 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 Q8_0 ≈20 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 Q8_0 ≈19 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 Q8_0 ≈18 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 Q8_0 ≈164 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 Q8_0 ≈17 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 FP16 ≈80 tok/s 试算 →
Llama 3.3 70B 47.4 GB 勉强装下 Q4_K_M ≈13 tok/s 试算 →
gpt-oss-120b 73.6 GB 本地不可行 需 2 张 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

RTX A6000 48GB 能跑 70B 吗?
能,勉强:Llama 3.3 70B Q4_K_M @8K 约 47.4GB,贴着装下,理论约 13 tok/s。想留余量或上 Q6/Q8,需要 A100 80GB 或双卡。
A6000 和双 3090(48GB)怎么选?
同容量:双 3090 聚合带宽更高(936×2×0.85 ≈ 1591 vs 768 GB/s)、更便宜,但要折腾 PCIe 层拆分、功耗 700W;A6000 单卡安静、确定性强、可 NVLink。要省心选 A6000,要性价比选双 3090。
二手 A6000 合理价是多少?
2026-08 约 $2,500-3,200【估】。超过 $3,200 不如看 Mac Studio M4 Max 64GB($2,899 新机器带保修)或双 3090 方案。

相关指南

在显卡兼容性查询工具中试算 RTX A6000 →

数据核实于 2026-09-01