GPUFits

第 1 步

第 1 步:本地部署是什么?和云端调 API 的四个区别

更新于 2026-09-11 · 核实于 2026-09-11

先把两个词说清楚

云端 API:你在网页或 App 里按一下回车,问题通过网络发到厂商的机房,那边的服务器算完,再把答案传回来。你按”用量”付费——通常按 token 计价(token 是模型眼里的字词碎片,一个汉字大约 1–2 个 token)。

本地部署:把一个开源模型的文件(几个 GB 到几十 GB)下载到你自己的电脑上,用你自己的显卡来算。装好之后,整个过程不经过任何别人的服务器。

动手体验只需要一条命令。先到 ollama.com 下载安装 Ollama(一个本地跑模型的免费工具),然后打开终端输入:

ollama run llama3.1:8b

它会自动下载一个 80 亿参数的模型(约 4.9GB)并开始对话。能跑通这一条,你就完成了人生第一次本地部署。

装好之后的日常形态很简单:Ollama 在后台常驻(菜单栏一个小图标),想聊天就打开它的界面或终端;它还支持本地 API,意味着你的其他软件——笔记、翻译、代码编辑器插件——也可以直接调用这个跑在你自己机器上的模型。

四个维度的区别

隐私:数据不出本机。 用 API,你的每段对话都要发给服务商——合同、病历、私有代码、没公开的稿子,无一例外。本地部署时,数据从键盘到显卡再到屏幕,全程在你自己的机器里。有个简单的验证方法:断网。模型照常回答,就证明没有任何东西被发出去。

成本:多用多省 vs 按量付费。 API 像出租车,按里程计价,偶尔坐很便宜,天天通勤就肉疼;本地像买车,先掏一笔硬件钱,之后每次使用的边际成本只剩电费——一张 350W 的显卡按一半负载跑一个月,电费大约 19 美元(按 $0.15/度估算)。所以答案取决于用量:以 Llama 3.1 8B 为例,最便宜的托管 API 每百万 token 约 0.03 美元,一个月用 1000 万 token 才几块钱,这时买显卡毫无意义;但如果你每天大量生成——批量处理文档、跑自动化脚本——API 月账单涨上来,硬件摊销加电费就会反超。到底谁划算没有通用答案,得拿自己的用量算,文末的对比器就是干这个的。

离线可用。 飞机上、公司内网、网络抖动、服务商宕机——这些场景本地部署全部免疫。模型文件在硬盘上,电在插座里,别的一概不需要。

完全可控。 API 模型会在你不知情的情况下升级、调价、改变行为:同一个提示词,上个月和下个月的回答可能不一样。本地的模型文件由你钉死版本,行为永远可复现;你还可以改系统提示词、调参数、甚至微调,没有任何平台规则管着你。

什么时候其实该用 API

本地部署是工具,不是信仰。两种情况老老实实选 API:

  • 偶尔用。 用量低的时候,API 月账单可能只有几块钱,比一张显卡的月电费还低,买硬件是纯浪费。
  • 追最新最强。 GPT-5、Claude 这类最顶尖的闭源模型没有开放权重,本地根本跑不了。开源模型进步很快,但天花板仍在云端。

很多人的最终形态是混合:敏感的、批量的活本地跑,最难的问题留给 API。

电脑配置一般也能跑吗?

能,但有取舍。模型必须放进显存才跑得快,放不下可以把一部分”卸载”到内存里凑合——代价是速度断崖式下跌。这笔账值不值,深入阅读:CPU 卸载:部分层放上显卡值得吗?。显存到底要多大、为什么它是第一位,正是下一篇的主题。

概念到此为止,现在算自己的账:把用量、电价和预算填进下面这个对比器,让数字替你做决定。

常见问题

没有独立显卡的电脑能本地部署吗?

能,只是慢。没有显卡时模型用 CPU 和内存跑,速度大约只有显卡的十分之一,聊天会觉得一个字一个字蹦。苹果芯片的 Mac 是例外:它的 CPU 和显卡共用同一块内存,没有独立显卡也能跑得不错。

本地跑开源模型要付钱吗?

模型本身免费——Llama、Qwen、DeepSeek 这些主流开源模型都可以直接下载。花钱的是硬件和电费。注意部分模型的许可证对商用场景有限制,拿去商用前看一眼它的许可证条款。

本地模型有 ChatGPT 聪明吗?

最顶尖的闭源模型(GPT-5、Claude 这个级别)没有开放权重,本地根本跑不了,天花板仍在云端。但开源模型进步很快,本地能跑的模型应付日常写作、翻译、代码辅助已经完全够用。

跑本地模型伤电脑吗?

不伤。它只是让显卡干满负荷的活,和你打大型游戏没有区别——风扇会响、耗电会涨,但都在硬件设计范围内。笔记本注意别堵出风口就行。