显卡库 / A100 80GB
A100 80GB 跑本地 LLM:能跑什么模型、速度多快
A100 80GB 是数据中心退役潮里的捡漏对象:80GB HBM2e、SXM 版 2039 GB/s 带宽,gpt-oss-120b Q4(约 73.6GB)勉强单卡,70B 宽裕、Q8_0(约 79GB)勉强贴顶。市场参考价约 $15,000【估】,无官方 MSRP。
它不是消费硬件:SXM 版没有显示输出、依赖服务器风道暴力散热,PCIe 版(带宽略低)才能进工作站;400W TDP、驱动与虚拟化生态都面向数据中心。买家画像是小团队/实验室:要 80GB 单卡确定性跑 120B 级 MoE 或 70B 高精度,又付不起 H100。个人用户几乎总是租比买划算——Vast.ai/RunPod 上 A100 时租远低于持有的机会成本,除非 7×24 满载。对比 H100:带宽差 64%、价差约 2 倍,单用户推理性价比其实更高。
规格
| 标称显存 | 80 GB |
| 可用显存(模型可用) | 80.0 GB |
| 显存带宽 | 2039 GB/s |
| 类型 | 独显 |
| 发布年份 | 2020 |
| MSRP | $15,000 |
| TDP | 400 W |
性价比指标
每美元带宽
0.14 GB/s/$
每美元可用显存
0.005 GB/$
按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈238 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈95 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈93 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | FP16 | ≈52 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | FP16 | ≈32 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 宽裕 | FP16 | ≈28 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 宽裕 | FP16 | ≈28 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 宽裕 | FP16 | ≈26 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 宽裕 | FP16 | ≈232 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 宽裕 | FP16 | ≈23 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | FP16 | ≈212 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 宽裕 | Q8_0 | ≈20 tok/s | 试算 → |
| gpt-oss-120b | 73.6 GB | 勉强装下 | Q4_K_M | ≈490 tok/s | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- A100 80GB 能跑什么模型?
- Q4_K_M @8K:gpt-oss-120b(约 73.6GB)勉强,70B 宽裕、Q8_0(约 79GB)勉强,其余模型全部宽裕。DeepSeek-R1 满血仍需 6 张以上。
- A100 能装进普通台式机吗?
- SXM 版不行:无显示输出、靠服务器风道散热。PCIe 版可以进工作站(需确认风道与电源),带宽与 SXM 版略有差异,价格通常也不同。
- 买 A100 还是租?
- 按利用率算:7×24 满载推理才勉强值得持有;间歇性使用、批量任务、微调,租(Vast.ai/RunPod 时租)便宜得多。个人用户默认租。
相关指南
数据核实于 2026-09-01