本地运行 DeepSeek-R1:完整硬件指南
更新于 2026-09-10 · 核实于 2026-08-04
DeepSeek-R1 是让所有人都想玩本地 AI 的模型——也是最不适合本地的模型。这里有完整的图景,包括 YouTube 视频不太强调的那些路径。所有显存数字按我们显存计算器的同一套公式计算:权重 = 参数量 × 每参数字节数,加上 KV 缓存和约 1.5GB 运行时开销。
R1 为什么不一样
DeepSeek-R1 是 **671B 混合专家(MoE)**模型:256 个路由专家加 1 个共享专家,每个 token 只激活其中 8 个,实际参与计算的参数约 37B。这个结构带来两个推论:
- 容量要求残酷:虽然每个 token 只用 37B,但 671B 参数必须全部驻留在内存里——你不知道下一个 token 会路由到哪几个专家,所有专家都得随时待命。Q4_K_M 下权重约 411GB,这个数字不会因为「只激活 37B」而变小。
- 速度出人意料地可以:生成是带宽受限的——每产出一个 token,硬件要读一遍参与计算的权重。R1 每 token 只读约 37B 参数对应的部分,所以它的生成速度相当于一个约 37B 的模型,而不是 671B——前提是你装得下它。
另一个关键设计是 MLA(多头潜在注意力):R1 缓存的是压缩后的潜在向量,61 层 × 每 token (512 + 64) 个值,而不是完整的 K/V 张量。结果是:
| 上下文 | R1(MLA)KV 缓存 | 对比:Llama-3.3-70B(标准 GQA) |
|---|---|---|
| 8K | 约 0.6GB | 约 2.7GB |
| 32K | 约 2.3GB | 约 10.7GB |
| 128K | 约 9.2GB | 约 42.9GB |
一个 671B 的模型,KV 缓存比 70B 的标准架构还小一个量级。这意味着 R1 的显存问题 100% 是权重问题,上下文长度几乎不用进你的容量规划。细节见 KV 缓存详解。
账单到底是多少
把公式跑一遍(bpW 取自 GGUF 实测文件大小校准值,总量按 8K 上下文 + 1.5GB 开销):
| 量化 | 权重 | 总量 @8K | 最少卡数(tight 判定) |
|---|---|---|---|
| Q8_0 | 714GB | 716GB | 30× 3090 / 9× A100 80GB |
| Q5_K_M | 479GB | 481GB | 21× 3090 / 7× A100 |
| Q4_K_M | 411GB | 413GB | 18× 3090 / 6× A100 |
| Q3_K_M | 336GB | 338GB | 15× 3090 / 5× A100 |
| Q2_K | 266GB | 268GB | 12× 3090 / 4× A100 |
开到 128K 上下文只再加约 9GB(感谢 MLA),基本不改变卡数。真正改变卡数的是量化档位。两个流传很广的说法在这里对不上账:
- 「8 张 3090(192GB)能跑 Q2」——不能。 Q2_K 总量约 268GB,192GB 差着 76GB,需要约 12 张。
- 「Q4 十四张卡搞定」——按同一口径是 18 张(24GB × 17 = 408GB,仍装不下 413GB)。
用二手价算账:3090 二手约 $1,100/张,12 张仅显卡就是 $13,000+,18 张是 $20,000——还没算多路主板、电源、机架和电。这就是为什么基本上没有人在消费级硬件上自托管完整 R1。
现实路径
路径 1:别跑完整模型,用蒸馏版(95% 的人该选这条)
DeepSeek 官方发布了一批用 R1 的推理轨迹微调的蒸馏版——底座是 Qwen 和 Llama,不是 R1 本身。按本站数据(Q4_K_M、8K 上下文):
| 蒸馏版(对标体量) | Q4 总量 | 装得下的硬件 | 理论速度【估】 |
|---|---|---|---|
| 8B(Llama-8B) | 约 7.5GB | RTX 3060 12GB,宽松 | 约 55 tok/s(3060) |
| 32B(Qwen-32B) | 约 24GB | 单张 3090/4090,刚好 | 约 35 tok/s(3090) |
| 70B(Llama-70B) | 约 47GB | 2× 3090 / A6000 / 96GB Mac Studio | 约 28 tok/s(双 3090) |
R1-Distill-Qwen-32B 是甜点:它以二十分之一的体量复现了 R1 大部分的「先打草稿再回答」的推理风格,一张二手 3090($1,100)就能跑。两个注意点:
- 24GB 只够 8K 上下文。32B 蒸馏开到 32K 上下文,总量涨到约 30GB——装不下了。想要长上下文,要么开 q8 KV 缓存(减半),要么上 48GB 方案。
- 蒸馏版继承的是推理风格,不是 R1 的知识广度。长尾知识、冷僻领域的表现会明显弱于 671B 本体。
Mac 用户的对应关系:Mac Studio M4 Max 64GB(可用约 48GB)跑 32B 蒸馏很从容,理论约 20 tok/s;96GB 的 M3 Ultra(可用约 72GB)可以跑 70B 蒸馏,理论约 14 tok/s。那些「我的 Mac 跑 R1」视频里跑的通常就是这类蒸馏版。
路径 2:多卡主机(发烧友路径)
按上面的表,Q4 需要 18× 3090 或 6× A100 80GB,Q2 需要 12× 3090 或 4× A100。几个只有真搭过才知道的点:
- 买 3090,别买 4090。 这个工作负载纯看显存容量:两张卡都是 24GB,而 4090 二手约 $2,400,是 3090($1,100)的两倍。为容量买单时,4090 多花的钱只买到你用不上的带宽。
- NVLink 不是必需,但互联决定体验。 张量并行可以走 PCIe,但每 token 都要跨卡交换激活值,互联越慢损耗越大。
- 速度预期放现实。 按带宽公式,6× A100 的理论上限非常高——但那是把 MoE 当稠密模型算的结果。专家路由、卡间通信和框架开销会把实际单流生成速度压到理论值的一小截,实践中常见报告落在每秒个位数到十几个 token。多卡的真正收益是装得下和批量吞吐,不是聊天更快。
搭建细节(层拆分、功耗、主板选择)见我们的多卡指南。
路径 3:CPU/内存推理(耐心者路径)
一台 512GB–1TB DDR4/DDR5 的二手双路 Epyc 工作站能把 Q4 的 R1 完整装进系统内存。按本站公式,系统内存带宽按 60–100GB/s 口径估算,Q4 下生成速度约 2.6 tok/s——多通道服务器内存能把带宽推高几倍,速度按比例提升,实践中报告多在每秒个位数。
这个速度适合批处理任务和「挂上跑一夜」的场景,不适合聊天。还有一个隐藏优点:内存加容量比显卡便宜得多,512GB DDR4 RECC 的二手价远低于等容量的任何 GPU 方案。
路径 4:API(大多数人的理性路径)
先纠正一个常见误解:DeepSeek 官方 API 已经跑不到 R1 本体了。官方接口已换代到 V4 系列——当前 deepseek-flash(V4.1-Flash)高峰时段每百万 token 输入 $0.30 / 输出 $1.20,非高峰半价。如果你要的是「DeepSeek 级别的推理能力」而不是「R1 这个特定模型」,这个价格便宜得惊人。
仍托管 R1 本体(R1-0528)的是第三方平台:Together AI、DeepInfra 等,按 token 计费,具体价格以各自定价页为准。
用数字感受一下差距:每天生成 100 万 token(很重的个人使用量),官方 API 高峰价约 $1.2/天;本地跑完整 R1 的 Q2 方案仅显卡就 $13,000+。除非你每月处理数十亿 token 或有硬性隐私/合规要求,API 仅凭成本就赢了——用我们的成本计算器跑一下自己的用量。
如果你还是要跑
- 从 unsloth 的动态量化版本开始。 他们的 R1 GGUF 提供 Q2_K_XL、Q3 等混合方案,让注意力层和路由等关键层保持更高精度,其余层激进压缩——在同等体积下明显好于朴素 Q2。注意 GGUF 是多个分卷文件,要全部下载。
- MLA 意味着长上下文很便宜。 R1 的 128K 上下文只比 8K 多约 9GB 显存。容量允许就放心开——这和那些 128K 只是宣传数字的模型不同。
- 警惕部分卸载。 显存差几十 GB 然后「剩下卸载到内存」,速度会立刻塌缩到系统内存带宽那一档(约 2–4 tok/s)——我们的公式里,部分卸载的等效带宽取显存和内存的较小值,断崖是结构性的,不是设置问题。
- 预期放现实一点。 即使 4–6 张 A100,单流生成也就在每秒个位数到十几个 token 的区间;这是一个「能跑」和「跑得像 API 一样快」之间有数量级差距的模型。
常见误区
- 「视频里 Mac 跑 R1 很流畅」:跑的是 32B 或更小的蒸馏版。苹果 2026 年起停售 256GB/512GB 的 Mac Studio,产品线封顶 96GB(可用约 72GB),连 Q2 的 268GB 都看不到尾灯。
- 「R1 长上下文肯定爆显存」:恰好相反——MLA 让 128K 只占约 9GB。R1 的瓶颈从来只有权重。
- 「671B 肯定慢得像蜗牛」:也相反——每 token 只激活 37B,带宽足够时它的生成速度对标 37B 模型。R1 的难题是容量,不是速度。
- 「先买两张卡,以后再扩」:多卡主机的平台(主板 PCIe 通道、电源、散热)决定了上限,事后扩容往往意味着推倒重来。动手前先按显卡检查器算清终点配置。
一句话结论
想要 R1 的推理风格:单卡 24GB 跑 32B 蒸馏,这是正确答案。想要 R1 本体:准备 12+ 张 3090 或一台大内存 Epyc 服务器,并接受个位数的 tok/s。只是想要推理能力:官方 API 每百万输出 token 一块钱上下,今天就能用。
常见问题
Mac Studio 能跑 DeepSeek-R1 吗?
跑不了完整 671B——即使 Q2_K 也需要约 268GB,而苹果 2026 年已停产 256GB/512GB 配置,产品线封顶 96GB(按统一内存可用比例折算约 72GB)。Mac Studio 能轻松跑的是优秀的 R1-Distill-Qwen-32B,大多数「Mac 跑 R1」视频实际演示的都是它。
本地跑完整 DeepSeek-R1 最便宜的现实方案是什么?
按显存公式,Q2_K 总量约 268GB,需要约 12 张 3090(二手约 $1,100/张)或 4 张 A100 80GB;Q4_K_M 约 413GB,需要 18 张 3090 或 6 张 A100。或者用 512GB+ 内存的二手 Epyc 服务器跑 CPU 推理。两条都是严肃工程,不是消费决策。
R1 蒸馏版和 R1 是一回事吗?
不是——它们是用 R1 的推理输出微调的 Qwen/Llama 模型。R1-Distill-Qwen-32B 以二十分之一的体量复现了大部分推理风格,Q4 下单张 24GB 显卡就能跑。对大多数人来说它就是正确答案。
我的显卡适合哪个 R1 蒸馏版?
12GB(RTX 3060/4070)选 8B 蒸馏,Q4 总量约 7.5GB,很宽松;24GB(3090/4090)选 32B 蒸馏,Q4 总量约 24GB 刚好装下;48GB+(A6000、双 3090、96GB Mac Studio)可以上 70B 蒸馏,Q4 总量约 47GB。
为什么 R1 的 KV 缓存这么小?
R1 使用 MLA(多头潜在注意力),缓存的是压缩后的潜在向量而不是完整的 K/V:61 层 × 每 token 576 个值。128K 上下文只占约 9GB,而同体量的标准架构需要几十 GB。R1 的显存瓶颈全在权重,不在上下文。