GPUFits

本地运行 DeepSeek-R1:完整硬件指南

更新于 2026-09-10 · 核实于 2026-08-04

DeepSeek-R1 是让所有人都想玩本地 AI 的模型——也是最不适合本地的模型。这里有完整的图景,包括 YouTube 视频不太强调的那些路径。所有显存数字按我们显存计算器的同一套公式计算:权重 = 参数量 × 每参数字节数,加上 KV 缓存和约 1.5GB 运行时开销。

R1 为什么不一样

DeepSeek-R1 是 **671B 混合专家(MoE)**模型:256 个路由专家加 1 个共享专家,每个 token 只激活其中 8 个,实际参与计算的参数约 37B。这个结构带来两个推论:

  • 容量要求残酷:虽然每个 token 只用 37B,但 671B 参数必须全部驻留在内存里——你不知道下一个 token 会路由到哪几个专家,所有专家都得随时待命。Q4_K_M 下权重约 411GB,这个数字不会因为「只激活 37B」而变小。
  • 速度出人意料地可以:生成是带宽受限的——每产出一个 token,硬件要读一遍参与计算的权重。R1 每 token 只读约 37B 参数对应的部分,所以它的生成速度相当于一个约 37B 的模型,而不是 671B——前提是你装得下它

另一个关键设计是 MLA(多头潜在注意力):R1 缓存的是压缩后的潜在向量,61 层 × 每 token (512 + 64) 个值,而不是完整的 K/V 张量。结果是:

上下文R1(MLA)KV 缓存对比:Llama-3.3-70B(标准 GQA)
8K约 0.6GB约 2.7GB
32K约 2.3GB约 10.7GB
128K约 9.2GB约 42.9GB

一个 671B 的模型,KV 缓存比 70B 的标准架构还小一个量级。这意味着 R1 的显存问题 100% 是权重问题,上下文长度几乎不用进你的容量规划。细节见 KV 缓存详解

账单到底是多少

把公式跑一遍(bpW 取自 GGUF 实测文件大小校准值,总量按 8K 上下文 + 1.5GB 开销):

量化权重总量 @8K最少卡数(tight 判定)
Q8_0714GB716GB30× 3090 / 9× A100 80GB
Q5_K_M479GB481GB21× 3090 / 7× A100
Q4_K_M411GB413GB18× 3090 / 6× A100
Q3_K_M336GB338GB15× 3090 / 5× A100
Q2_K266GB268GB12× 3090 / 4× A100

开到 128K 上下文只再加约 9GB(感谢 MLA),基本不改变卡数。真正改变卡数的是量化档位。两个流传很广的说法在这里对不上账:

  • 「8 张 3090(192GB)能跑 Q2」——不能。 Q2_K 总量约 268GB,192GB 差着 76GB,需要约 12 张。
  • 「Q4 十四张卡搞定」——按同一口径是 18 张(24GB × 17 = 408GB,仍装不下 413GB)。

用二手价算账:3090 二手约 $1,100/张,12 张仅显卡就是 $13,000+,18 张是 $20,000——还没算多路主板、电源、机架和电。这就是为什么基本上没有人在消费级硬件上自托管完整 R1。

现实路径

路径 1:别跑完整模型,用蒸馏版(95% 的人该选这条)

DeepSeek 官方发布了一批用 R1 的推理轨迹微调的蒸馏版——底座是 Qwen 和 Llama,不是 R1 本身。按本站数据(Q4_K_M、8K 上下文):

蒸馏版(对标体量)Q4 总量装得下的硬件理论速度【估】
8B(Llama-8B)约 7.5GBRTX 3060 12GB,宽松约 55 tok/s(3060)
32B(Qwen-32B)约 24GB单张 3090/4090,刚好约 35 tok/s(3090)
70B(Llama-70B)约 47GB2× 3090 / A6000 / 96GB Mac Studio约 28 tok/s(双 3090)

R1-Distill-Qwen-32B 是甜点:它以二十分之一的体量复现了 R1 大部分的「先打草稿再回答」的推理风格,一张二手 3090($1,100)就能跑。两个注意点:

  • 24GB 只够 8K 上下文。32B 蒸馏开到 32K 上下文,总量涨到约 30GB——装不下了。想要长上下文,要么开 q8 KV 缓存(减半),要么上 48GB 方案。
  • 蒸馏版继承的是推理风格,不是 R1 的知识广度。长尾知识、冷僻领域的表现会明显弱于 671B 本体。

Mac 用户的对应关系:Mac Studio M4 Max 64GB(可用约 48GB)跑 32B 蒸馏很从容,理论约 20 tok/s;96GB 的 M3 Ultra(可用约 72GB)可以跑 70B 蒸馏,理论约 14 tok/s。那些「我的 Mac 跑 R1」视频里跑的通常就是这类蒸馏版。

路径 2:多卡主机(发烧友路径)

按上面的表,Q4 需要 18× 3090 或 6× A100 80GB,Q2 需要 12× 3090 或 4× A100。几个只有真搭过才知道的点:

  • 买 3090,别买 4090。 这个工作负载纯看显存容量:两张卡都是 24GB,而 4090 二手约 $2,400,是 3090($1,100)的两倍。为容量买单时,4090 多花的钱只买到你用不上的带宽。
  • NVLink 不是必需,但互联决定体验。 张量并行可以走 PCIe,但每 token 都要跨卡交换激活值,互联越慢损耗越大。
  • 速度预期放现实。 按带宽公式,6× A100 的理论上限非常高——但那是把 MoE 当稠密模型算的结果。专家路由、卡间通信和框架开销会把实际单流生成速度压到理论值的一小截,实践中常见报告落在每秒个位数到十几个 token。多卡的真正收益是装得下批量吞吐,不是聊天更快。

搭建细节(层拆分、功耗、主板选择)见我们的多卡指南

路径 3:CPU/内存推理(耐心者路径)

一台 512GB–1TB DDR4/DDR5 的二手双路 Epyc 工作站能把 Q4 的 R1 完整装进系统内存。按本站公式,系统内存带宽按 60–100GB/s 口径估算,Q4 下生成速度约 2.6 tok/s——多通道服务器内存能把带宽推高几倍,速度按比例提升,实践中报告多在每秒个位数。

这个速度适合批处理任务和「挂上跑一夜」的场景,不适合聊天。还有一个隐藏优点:内存加容量比显卡便宜得多,512GB DDR4 RECC 的二手价远低于等容量的任何 GPU 方案。

路径 4:API(大多数人的理性路径)

先纠正一个常见误解:DeepSeek 官方 API 已经跑不到 R1 本体了。官方接口已换代到 V4 系列——当前 deepseek-flash(V4.1-Flash)高峰时段每百万 token 输入 $0.30 / 输出 $1.20,非高峰半价。如果你要的是「DeepSeek 级别的推理能力」而不是「R1 这个特定模型」,这个价格便宜得惊人。

仍托管 R1 本体(R1-0528)的是第三方平台:Together AI、DeepInfra 等,按 token 计费,具体价格以各自定价页为准。

用数字感受一下差距:每天生成 100 万 token(很重的个人使用量),官方 API 高峰价约 $1.2/天;本地跑完整 R1 的 Q2 方案仅显卡就 $13,000+。除非你每月处理数十亿 token 或有硬性隐私/合规要求,API 仅凭成本就赢了——用我们的成本计算器跑一下自己的用量。

如果你还是要跑

  1. 从 unsloth 的动态量化版本开始。 他们的 R1 GGUF 提供 Q2_K_XL、Q3 等混合方案,让注意力层和路由等关键层保持更高精度,其余层激进压缩——在同等体积下明显好于朴素 Q2。注意 GGUF 是多个分卷文件,要全部下载。
  2. MLA 意味着长上下文很便宜。 R1 的 128K 上下文只比 8K 多约 9GB 显存。容量允许就放心开——这和那些 128K 只是宣传数字的模型不同。
  3. 警惕部分卸载。 显存差几十 GB 然后「剩下卸载到内存」,速度会立刻塌缩到系统内存带宽那一档(约 2–4 tok/s)——我们的公式里,部分卸载的等效带宽取显存和内存的较小值,断崖是结构性的,不是设置问题。
  4. 预期放现实一点。 即使 4–6 张 A100,单流生成也就在每秒个位数到十几个 token 的区间;这是一个「能跑」和「跑得像 API 一样快」之间有数量级差距的模型。

常见误区

  • 「视频里 Mac 跑 R1 很流畅」:跑的是 32B 或更小的蒸馏版。苹果 2026 年起停售 256GB/512GB 的 Mac Studio,产品线封顶 96GB(可用约 72GB),连 Q2 的 268GB 都看不到尾灯。
  • 「R1 长上下文肯定爆显存」:恰好相反——MLA 让 128K 只占约 9GB。R1 的瓶颈从来只有权重。
  • 「671B 肯定慢得像蜗牛」:也相反——每 token 只激活 37B,带宽足够时它的生成速度对标 37B 模型。R1 的难题是容量,不是速度。
  • 「先买两张卡,以后再扩」:多卡主机的平台(主板 PCIe 通道、电源、散热)决定了上限,事后扩容往往意味着推倒重来。动手前先按显卡检查器算清终点配置。

一句话结论

想要 R1 的推理风格:单卡 24GB 跑 32B 蒸馏,这是正确答案。想要 R1 本体:准备 12+ 张 3090 或一台大内存 Epyc 服务器,并接受个位数的 tok/s。只是想要推理能力:官方 API 每百万输出 token 一块钱上下,今天就能用。

常见问题

Mac Studio 能跑 DeepSeek-R1 吗?

跑不了完整 671B——即使 Q2_K 也需要约 268GB,而苹果 2026 年已停产 256GB/512GB 配置,产品线封顶 96GB(按统一内存可用比例折算约 72GB)。Mac Studio 能轻松跑的是优秀的 R1-Distill-Qwen-32B,大多数「Mac 跑 R1」视频实际演示的都是它。

本地跑完整 DeepSeek-R1 最便宜的现实方案是什么?

按显存公式,Q2_K 总量约 268GB,需要约 12 张 3090(二手约 $1,100/张)或 4 张 A100 80GB;Q4_K_M 约 413GB,需要 18 张 3090 或 6 张 A100。或者用 512GB+ 内存的二手 Epyc 服务器跑 CPU 推理。两条都是严肃工程,不是消费决策。

R1 蒸馏版和 R1 是一回事吗?

不是——它们是用 R1 的推理输出微调的 Qwen/Llama 模型。R1-Distill-Qwen-32B 以二十分之一的体量复现了大部分推理风格,Q4 下单张 24GB 显卡就能跑。对大多数人来说它就是正确答案。

我的显卡适合哪个 R1 蒸馏版?

12GB(RTX 3060/4070)选 8B 蒸馏,Q4 总量约 7.5GB,很宽松;24GB(3090/4090)选 32B 蒸馏,Q4 总量约 24GB 刚好装下;48GB+(A6000、双 3090、96GB Mac Studio)可以上 70B 蒸馏,Q4 总量约 47GB。

为什么 R1 的 KV 缓存这么小?

R1 使用 MLA(多头潜在注意力),缓存的是压缩后的潜在向量而不是完整的 K/V:61 层 × 每 token 576 个值。128K 上下文只占约 9GB,而同体量的标准架构需要几十 GB。R1 的显存瓶颈全在权重,不在上下文。

来源