模型库 / DeepSeek-R1 671B
DeepSeek-R1 671B 显存需求与显卡搭配
DeepSeek-R1 是开源推理模型的图腾,也是硬件需求的黑洞:671B 总参数、37B 激活的 MoE(256 路由专家 + 1 共享专家、每 token 激活 8),MIT 协议。它采用 MLA 压缩潜向量注意力——KV 缓存 = 层数 × (kvLoraRank + qkRopeHeadDim) × 字节数,8K 下仅约 1.2GB,与 8B 模型同级;KV 不是墙,权重才是:Q4_K_M 总量约 413.6GB,消费硬件无单卡解。
现实路径只有三条:unsloth 动态量化(1.58-2.51bit,约 161-250GB,需多卡 A100 或双 M3 Ultra 级内存)、跑官方蒸馏版(R1-Distill-Qwen-32B 等,24GB 卡即可)、或直接调 API。37B 激活参数意味着就算装得下,速度也是个位到十位 tok/s(8×A100 理论约 44 tok/s)。满血 R1 是发烧友与实验室的玩具,不是理性消费——但对推理模型能力的认知基准,它是必答题。
架构规格
| 总参数 | 671B |
| 激活参数(MoE:显存按总参数装,速度按激活参数跑) | 37B |
| 层数 | 61 |
| KV 头数(MLA 压缩潜向量:KV = 层数 × (kvLoraRank + qkRopeHeadDim) × 字节数,不适用标准 GQA 公式) | — |
| Head 维度 | — |
| 原生上下文 | 128K |
| 开源协议 | mit |
| 每 token KV 字节数(fp16) | 68.6 KB |
MLA 架构:KV 按 61 层 × (512+64) 维压缩潜向量计算,上表 KV 列为 MLA 公式实算,与标准 GQA 模型口径不同。
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 713.8 GB | 715.9 GB |
| Q6_K | 551.1 GB | 553.1 GB |
| Q4_K_M | 411.0 GB | 413.1 GB |
| Q3_K_M | 335.5 GB | 337.6 GB |
| Q2_K | 265.9 GB | 268.0 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 3090 | 24.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 4090 | 24.0 GB | 本地不可行 | — | — | 试算 → |
| RTX 5090 | 32.0 GB | 本地不可行 | — | — | 试算 → |
| RTX A6000 | 48.0 GB | 本地不可行 | — | — | 试算 → |
| A100 80GB | 80.0 GB | 本地不可行 | — | — | 试算 → |
| H100 80GB | 80.0 GB | 本地不可行 | — | — | 试算 → |
| RX 7900 XTX | 24.0 GB | 本地不可行 | — | — | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 本地不可行 | — | — | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 本地不可行 | — | — | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 本地跑满血 DeepSeek-R1 到底要什么硬件?
- Q4_K_M 约 413.6GB:至少 6×A100 80GB 或 4×H100;1.58bit 动态量化约 161GB,也要 2×H100 或 3 台 M3 Ultra 96GB 级内存。没有消费级单卡/双卡路径。
- DeepSeek-R1 的 KV 缓存为什么那么小?
- MLA 多头潜向量注意力:每层只存 512+64 维的压缩潜向量而非完整 K/V,8K KV 约 1.2GB——和 8B 稠密模型同级,这也是 671B 模型 KV 不爆的原因。
- 普通玩家怎么用上 R1 的能力?
- 两条务实路径:官方蒸馏版 R1-Distill-Qwen-32B(24GB 卡勉强可跑)承接了大部分推理风格;或直接 API,成本远低于为满血 R1 购置硬件。
相关指南
在显卡兼容性查询工具中试算 DeepSeek-R1 671B →
数据核实于 2026-09-01