GPUFits

第 6 步

第 6 步:进阶地图:跑通之后,往哪走

更新于 2026-09-11 · 核实于 2026-09-11

到这里,你已经能挑模型、装环境、跑起来、修毛病了。最后这一步不设终点,给你一张地图:四个值得继续深入的方向,每个都附一篇站内的专题指南。文中速度均为理论估算,实际 ±30%。

方向一:长上下文的显存代价

模型宣传页上的「支持 128K 上下文」是架构能力,不是你显卡的能力。KV 缓存(模型记住对话内容的草稿纸)随上下文长度严格线性增长,而且单价不低:Llama-3.1-8B 的 Q4 权重只有 4.9GB,但 128K 上下文的 KV 缓存要约 17.2GB——上下文比模型本体贵 3.5 倍

它还顺便收第二笔税:上下文越长,每生成一个字要读的草稿越多,速度越慢。同一张 RTX 4090 跑 8B 模型,短上下文理论约 154 tok/s,128K 时只剩约 34 tok/s。

记住一句就够:上下文按任务定长,不按上限定长。日常聊天 4–8K,RAG 问答 8–16K,百页 PDF 才需要 32K 往上。完整推导见 长上下文的显存代价

方向二:MoE 模型的特殊账本

Qwen3-30B-A3B、gpt-oss-120b 这类 MoE(混合专家)模型,卡片上永远有两个参数数字,新手最常拿错:

  • 显存按总参数装:下一个字会激活哪些「专家」是生成时才决定的,所以全部参数都得驻留显存。Qwen3-30B-A3B 总参数 30.5B,Q4 档要装约 21GB——和稠密 32B 几乎一样。
  • 速度按激活参数跑:每个字只动用 3.3B 参数,只需读约 2.0GB 权重。同一张 4090 上,它理论约 374 tok/s,而显存占用几乎相同的稠密 32B 只有约 38 tok/s——差 10 倍。

所以 MoE 不帮你省显存,它让「装得下的硬件」快得离谱;它也是大内存主机和 CPU 卸载场景的最大例外。细节见 MoE 模型硬件要求

方向三:后端怎么选——Ollama、llama.cpp、vLLM

三个名字常被一起提到,其实它们是三种定位:

  • Ollama:一键安装、一条命令跑模型,个人日常使用的默认答案。它的底层引擎就是 llama.cpp。
  • llama.cpp:引擎本体,所有参数对你开放(-ngl--cache-type-k、多卡拆分比例……)。当你需要极限控制、嵌入式部署、或想弄明白每个开关在干什么时用它。
  • vLLM:给「多人同时用」准备的服务框架,靠连续批处理把几十上百个并发请求的总吞吐拉满。一个人聊天用不上它的本事,做成团队或产品的 API 服务时才是主场。

一句话:自己用,从 Ollama 起步、进阶玩 llama.cpp;对外提供服务,上 vLLM。

方向四:什么时候放弃本地,去租云

本地不是信仰,是一笔账。出现这三种情况,该认真考虑租云 GPU(按小时计费,用完就还):

  1. 偶尔才用超大模型:70B+ 一个月跑几次,为它配 4 张卡不如每次租几小时 A100。
  2. 短期批量任务:一周内要处理几万条数据,租一台多卡机器突击完,比买硬件便宜得多。
  3. 流量不可控的对外服务:用户量忽大忽小,云能随时扩容,自建不能。

反过来,每天都在用的模型,本地硬件的回本速度比你想象的快——这也是本站提供成本对比工具的原因。决定「坚守本地加卡扩容」之前,先读 多卡跑本地大模型,知道多卡买的是什么、不解决什么。

毕业礼物:一张自己的装机单

学习路径到此结束,但你的硬件规划才刚开始。把目标模型和预算交给下面的配置生成器,让它替你算出第一套(或下一套)装备:

深入阅读:长上下文的显存代价 · MoE 模型硬件要求 · 多卡跑本地大模型

常见问题

vLLM 是不是比 Ollama 快?

一个人聊天时不会更快,甚至因为更重而感觉更麻烦。它的强项是多人并发:几十个请求同时进来时,靠连续批处理把总吞吐拉上去。单人日常用 Ollama 就好。

MoE 模型是不是更省显存?

不是。显存按总参数一分不少地付,它省的是每生成一个 token 要读的权重量——所以是更快,不是更小。装不装得下,永远看总参数。

先加一张显卡,还是干脆租云?

看使用频率。每天都在用的模型,买卡或加卡划算——云 GPU 按小时计费,天天跑很快超过二手卡的钱;一个月只用几次的大模型,租云几乎总是更省。