GPUFits

显卡库 / H100 80GB

H100 80GB 跑本地 LLM:能跑什么模型、速度多快

H100 80GB 是推理性能的终点,也是个人买家不该碰的东西:80GB HBM3、约 3.35 TB/s 带宽,跑 70B Q4 理论约 58 tok/s、gpt-oss-120b 理论约 805 tok/s(按 5.1B 激活),新卡市场 $25,000-40,000,取 $30,000【估】。

它的设计目标是训练与大规模并发 serving——单用户本地推理根本喂不饱它:decode 阶段带宽利用率、700W 功耗都是浪费,FP8/张量并行的杀手级特性也用不上。正确用法是租:按小时租 H100 跑批量推理或微调,比持有便宜两个数量级。唯一该买的人群是有确定性需求的机构。对个人而言它的意义是参照系:本站的速度/显存数据能告诉你需求离 H100 有多远——而绝大多数本地需求,一张 3090 或 Mac Studio 就够了。

规格

标称显存80 GB
可用显存(模型可用)80.0 GB
显存带宽3350 GB/s
类型独显
发布年份2022
MSRP$30,000
TDP700 W

性价比指标

每美元带宽
0.11 GB/s/$
每美元可用显存
0.003 GB/$

按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈391 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈156 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈153 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈85 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 FP16 ≈52 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 FP16 ≈46 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 FP16 ≈45 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 FP16 ≈42 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 FP16 ≈381 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 FP16 ≈38 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 FP16 ≈349 tok/s 试算 →
Llama 3.3 70B 47.4 GB 宽裕 Q8_0 ≈33 tok/s 试算 →
gpt-oss-120b 73.6 GB 勉强装下 Q4_K_M ≈804 tok/s 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

H100 80GB 能跑什么模型?
本站 14 个模型里除 DeepSeek-R1 满血(需 4 张以上)外全部宽裕;gpt-oss-120b Q4 理论约 805 tok/s,是单卡体验的天花板。
个人值得买 H100 跑本地 LLM 吗?
不值得。$30,000 的持有成本按 Vast.ai/RunPod 时租折算能用很多年;且单用户 decode 喂不饱 3.35 TB/s 带宽,大量性能闲置。
H100 和 A100 推理差多少?
带宽 3350 vs 2039 GB/s,decode 理论快 64%;价格约 2 倍。单用户推理性价比 A100 更高;H100 的价值在训练、FP8 与高并发 serving。

相关指南

在显卡兼容性查询工具中试算 H100 80GB →

数据核实于 2026-09-01