本地 vs API 成本计算器
对比本地跑大模型与调用托管 API 的真实成本:硬件摊销、电费与 token 定价,给出盈亏平衡点。
成本按 75% 输入 / 25% 输出 token 估算。这里只出现有「同模型托管 API」的模型——只有这才是同口径对比。
托管 API
$6.6
deepinfra · meta-llama/Meta-Llama-3.1-8B-Instruct · $0.28/月
- groq: $0.58/月
本地部署
$480
rtx-3060-12gb · 7.5 GB
- 硬件(参考价): $260
- 硬件摊销: $10.83/月
- 电费: $9.18/月
结论
该用量下 API 更划算——按当前 token 价格与电价,本地硬件无法回本。
我们不鼓吹任何一边。持续高用量时本地占优;用量低或波动大时 API 几乎总是更便宜。隐私与离线使用是选择本地的独立理由,本计算器不为其定价。
估算值。API 价格每月从官方定价页核实;硬件价为人工维护参考价;电费按 GPU 平均 50% 负载估算。本地与托管 API 的速度/质量差异未计入价格。
这个对比器怎么用
- 拖月用量滑块(1–200M tokens)。不知道用量的话,一次普通对话约几百到几千 token,10M/月大致等于每天上百次对话。
- 选模型。只列出存在「同一模型」托管 API 的开源模型——同口径才有成本可比性。
- 调摊销月数与电价。摊销默认 24 个月,电价默认 $0.15/kWh,按你所在地改。
- 读结果。本地方案的硬件由工具自动挑选:能装下该模型 Q4_K_M @ 8K 的最便宜组合,依次找单卡舒适、单卡紧张、同型号 2–4 卡。
两边的成本各由什么构成
API 侧
月成本 = 用量 × (0.75 × 输入价 + 0.25 × 输出价),输入输出按 3:1 假设。取该模型所有托管 API 中加权后最便宜的一家。单价来自本站价目表(2026-09-01 经官方定价页核实),单位是每百万 token 美元。
本地侧
月成本 = 硬件摊销 + 电费。硬件价取二手价(上市满两年的卡)或 MSRP,除以摊销月数。电费 = 显卡 TDP × 50% 平均负载 × 720 小时 × 电价——一张 350W 的 RTX 3090 在 $0.15/kWh 下每月约 $19,相比摊销是小头。
盈亏平衡点怎么读
盈亏平衡点 = 硬件价 ÷(API 月成本 − 本地月电费),单位是月:本地跑到第几个月开始比 API 省钱。读法分三种情况:
- 平衡点小于你的摊销周期——本地划算,且硬件摊完后每月只剩电费。
- 平衡点远大于摊销周期——按当前用量买卡回不了本,继续用 API。
- 显示「无平衡点」——API 月成本还低于本地电费,用量再低一档也轮不到本地赢。小模型最容易出现这种情况:Llama 3.1 8B 最便宜的托管 API 加权后约 $0.0275/M token,10M/月 用量只花约 $0.28,比一张 3060 的月电费还低。平衡点对 API 单价敏感,70B 这类单价更高的模型才会落到现实的月数内。
这是估算,局限在哪
- 电费按 TDP 的 50% 恒定负载估算,实际负载随使用量波动。
- 硬件不计残值、维修与升级;二手价为美国市场参考价,因地区与行情而异。
- API 侧未计缓存命中折扣、批量折扣与峰谷定价,实际账单可能更低。
- 速度差异没有折算成钱:本地单卡与云端 API 的 tok/s 可能差一个量级,交互体验不同。
- 价目表为 2026-09 快照,API 价格变动频繁,做大额决策前请核对官网现价。
常见问题
- 本地跑大模型和调 API 哪个更划算?
- 取决于用量。用量低或波动大时 API 几乎总是更便宜;持续高用量时本地开始占优——一张 1100 美元的二手 3090 只有在你的 API 月账单超过硬件摊销加电费时才能回本。
- 本地推理的电费要多少?
- 按 GPU 平均 50% 负载估算,一张 350W 的卡按 $0.15/kWh 电价每月约 $19。相比硬件摊销,电费占比很小。
- 为什么这个计算器里只有部分模型?
- 我们只把本地模型与「同一模型」的托管 API 对比——这是唯一同口径的比较。拿本地 70B 去对比闭源前沿模型是质量对比,不是成本对比。
- API 侧的 token 单价是怎么算的?
- 取该模型所有托管 API 中最便宜的一家,按输入:输出 = 3:1 加权(0.75×输入价 + 0.25×输出价)。以 Llama 3.1 8B 为例,最便宜的托管 API 为每百万 token $0.02/$0.05,加权后 10M token 每月约 $0.28。缓存命中折扣与峰谷价未计入。