指南
深度指南:每 B 参数显存速查、量化档位详解、各预算显卡推荐、Mac vs GPU 对比、多卡方案与云 GPU 租用成本分析,帮你把本地大模型部署的每一步都算清楚。
-
2026 年本地大模型显卡选购指南:全预算覆盖
2026 年本地 LLM 硬件选购:二手性价比之王 RTX 3090、新卡首选 RTX 5090、大显存方案 Mac Studio,以及哪些不要买。
核实于 2026-08-04
-
CPU 卸载:部分层放上显卡值得吗?
llama.cpp -ngl 详解:部分卸载对速度的影响(60–100 GB/s 内存墙)、什么时候是合理妥协,以及什么时候该直接换小模型。
核实于 2026-08-04
-
FP8、NVFP4 与 GGUF 量化怎么选:数据中心格式 vs llama.cpp 格式
FP8、NVFP4 是跑在 Tensor Core 上的数据中心低精度格式,GGUF Q4/Q8 是 llama.cpp 的通用量化。讲清两者的硬件门槛、体积与质量取舍,以及你该用哪套生态。
核实于 2026-09-10
-
每十亿参数需要多少显存?(2026 速查表)
显存估算速查表:FP16、Q8、Q6、Q5、Q4、Q3、Q2 各量化档位下每十亿参数占用多少 GB,加上 KV 缓存与运行时开销,附完整算例与显卡对照。
核实于 2026-08-04
-
KV 缓存详解:长上下文为什么吃掉你的显存
KV 缓存是什么,精确公式(2 × 层数 × KV 头数 × 头维度 × 字节数 × token 数),为什么 128K 上下文可能比模型本身还贵,以及 MLA 和 q8 KV 如何改变算法。
核实于 2026-08-04
-
长上下文的显存代价:线性增长、架构差异与按需定长
上下文每翻一倍,KV 缓存就翻一倍。逐模型的每 token KV 成本对比、GQA/MLA/滑窗架构差异、长上下文对速度的影响,以及按任务选上下文长度的实用方法。
核实于 2026-09-10
-
Mac 还是显卡?统一内存跑 LLM 全面解析
Apple Silicon 统一内存对比 NVIDIA 显存:真实带宽数据(273/546/819 GB/s)、75% 可用内存规则、按站点公式算的四个实例,以及谁该买哪种方案。
核实于 2026-08-04
-
显存带宽为什么决定 LLM 推理速度:decode 机制与估算公式
decode 阶段每个 token 都要重读全部权重,所以 tok/s ≈ 带宽 × 0.75 ÷ 每 token 权重 GB。解释为什么算力和核心数几乎无关、预填充是例外,以及 MoE 为什么快。
核实于 2026-09-10
-
MoE 模型硬件要求:显存按总参数算,速度按激活参数算
Qwen3-30B-A3B、gpt-oss-120b、DeepSeek-R1 这类 MoE 模型有两个参数数字:显存按总参数装,速度按激活参数跑。本文用公式算清容量、速度与选型。
核实于 2026-09-10
-
多卡跑本地大模型:NVLink、PCIe 与层拆分详解
如何用多张显卡跑 70B+ 模型:张量并行 vs 层拆分、为什么推理不需要 NVLink,以及多卡速度的真实算法。
核实于 2026-08-04
-
量化详解:Q4 与 Q8 到底差多少?
GGUF 量化到底牺牲了什么:Q8_0、Q6_K、Q5_K_M、Q4_K_M、Q3、Q2 的实测文件体积、质量对比、速度与显存算例、按场景选档,以及什么时候才该用 Q4 以下。
核实于 2026-08-04
-
本地运行 DeepSeek-R1:完整硬件指南
DeepSeek-R1 671B 在 Q4 下需要约 413GB——这里是所有现实路径:Mac Studio 的真相、多卡主机的账单、真正装得下的 R1 蒸馏版,以及什么时候该直接用 API。
核实于 2026-08-04
-
GGUF 本地部署实操:llama.cpp 与 Ollama 两条路径
从下载 GGUF 到跑通第一条回复的完整流程:量化档怎么选、llama.cpp 的 -ngl 与 --ctx-size、Ollama 的 num_ctx,以及如何验证实际显存占用和 tok/s。
核实于 2026-09-10