GPUFits

显卡库 / A100 80GB

A100 80GB 跑本地 LLM:能跑什么模型、速度多快

A100 80GB 是数据中心退役潮里的捡漏对象:80GB HBM2e、SXM 版 2039 GB/s 带宽,gpt-oss-120b Q4(约 73.6GB)勉强单卡,70B 宽裕、Q8_0(约 79GB)勉强贴顶。市场参考价约 $15,000【估】,无官方 MSRP。

它不是消费硬件:SXM 版没有显示输出、依赖服务器风道暴力散热,PCIe 版(带宽略低)才能进工作站;400W TDP、驱动与虚拟化生态都面向数据中心。买家画像是小团队/实验室:要 80GB 单卡确定性跑 120B 级 MoE 或 70B 高精度,又付不起 H100。个人用户几乎总是租比买划算——Vast.ai/RunPod 上 A100 时租远低于持有的机会成本,除非 7×24 满载。对比 H100:带宽差 64%、价差约 2 倍,单用户推理性价比其实更高。

规格

标称显存80 GB
可用显存(模型可用)80.0 GB
显存带宽2039 GB/s
类型独显
发布年份2020
MSRP$15,000
TDP400 W

性价比指标

每美元带宽
0.14 GB/s/$
每美元可用显存
0.005 GB/$

按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈238 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈95 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈93 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈52 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 FP16 ≈32 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 FP16 ≈28 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 FP16 ≈28 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 FP16 ≈26 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 FP16 ≈232 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 FP16 ≈23 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 FP16 ≈212 tok/s 试算 →
Llama 3.3 70B 47.4 GB 宽裕 Q8_0 ≈20 tok/s 试算 →
gpt-oss-120b 73.6 GB 勉强装下 Q4_K_M ≈490 tok/s 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

A100 80GB 能跑什么模型?
Q4_K_M @8K:gpt-oss-120b(约 73.6GB)勉强,70B 宽裕、Q8_0(约 79GB)勉强,其余模型全部宽裕。DeepSeek-R1 满血仍需 6 张以上。
A100 能装进普通台式机吗?
SXM 版不行:无显示输出、靠服务器风道散热。PCIe 版可以进工作站(需确认风道与电源),带宽与 SXM 版略有差异,价格通常也不同。
买 A100 还是租?
按利用率算:7×24 满载推理才勉强值得持有;间歇性使用、批量任务、微调,租(Vast.ai/RunPod 时租)便宜得多。个人用户默认租。

相关指南

在显卡兼容性查询工具中试算 A100 80GB →

数据核实于 2026-09-01