GPUFits

本地 vs API 成本计算器

对比本地跑大模型与调用托管 API 的真实成本:硬件摊销、电费与 token 定价,给出盈亏平衡点。

本地 vs API 成本计算器

成本按 75% 输入 / 25% 输出 token 估算。这里只出现有「同模型托管 API」的模型——只有这才是同口径对比。

托管 API

$6.6

deepinfra · meta-llama/Meta-Llama-3.1-8B-Instruct · $0.28/月

  • groq: $0.58/月

本地部署

$480

rtx-3060-12gb · 7.5 GB

  • 硬件(参考价): $260
  • 硬件摊销: $10.83/月
  • 电费: $9.18/月

结论

该用量下 API 更划算——按当前 token 价格与电价,本地硬件无法回本。

我们不鼓吹任何一边。持续高用量时本地占优;用量低或波动大时 API 几乎总是更便宜。隐私与离线使用是选择本地的独立理由,本计算器不为其定价。

估算值。API 价格每月从官方定价页核实;硬件价为人工维护参考价;电费按 GPU 平均 50% 负载估算。本地与托管 API 的速度/质量差异未计入价格。

这个对比器怎么用

  1. 拖月用量滑块(1–200M tokens)。不知道用量的话,一次普通对话约几百到几千 token,10M/月大致等于每天上百次对话。
  2. 选模型。只列出存在「同一模型」托管 API 的开源模型——同口径才有成本可比性。
  3. 调摊销月数与电价。摊销默认 24 个月,电价默认 $0.15/kWh,按你所在地改。
  4. 读结果。本地方案的硬件由工具自动挑选:能装下该模型 Q4_K_M @ 8K 的最便宜组合,依次找单卡舒适、单卡紧张、同型号 2–4 卡。

两边的成本各由什么构成

API 侧

月成本 = 用量 × (0.75 × 输入价 + 0.25 × 输出价),输入输出按 3:1 假设。取该模型所有托管 API 中加权后最便宜的一家。单价来自本站价目表(2026-09-01 经官方定价页核实),单位是每百万 token 美元。

本地侧

月成本 = 硬件摊销 + 电费。硬件价取二手价(上市满两年的卡)或 MSRP,除以摊销月数。电费 = 显卡 TDP × 50% 平均负载 × 720 小时 × 电价——一张 350W 的 RTX 3090 在 $0.15/kWh 下每月约 $19,相比摊销是小头。

盈亏平衡点怎么读

盈亏平衡点 = 硬件价 ÷(API 月成本 − 本地月电费),单位是月:本地跑到第几个月开始比 API 省钱。读法分三种情况:

  • 平衡点小于你的摊销周期——本地划算,且硬件摊完后每月只剩电费。
  • 平衡点远大于摊销周期——按当前用量买卡回不了本,继续用 API。
  • 显示「无平衡点」——API 月成本还低于本地电费,用量再低一档也轮不到本地赢。小模型最容易出现这种情况:Llama 3.1 8B 最便宜的托管 API 加权后约 $0.0275/M token,10M/月 用量只花约 $0.28,比一张 3060 的月电费还低。平衡点对 API 单价敏感,70B 这类单价更高的模型才会落到现实的月数内。

这是估算,局限在哪

  • 电费按 TDP 的 50% 恒定负载估算,实际负载随使用量波动。
  • 硬件不计残值、维修与升级;二手价为美国市场参考价,因地区与行情而异。
  • API 侧未计缓存命中折扣、批量折扣与峰谷定价,实际账单可能更低。
  • 速度差异没有折算成钱:本地单卡与云端 API 的 tok/s 可能差一个量级,交互体验不同。
  • 价目表为 2026-09 快照,API 价格变动频繁,做大额决策前请核对官网现价。

常见问题

本地跑大模型和调 API 哪个更划算?
取决于用量。用量低或波动大时 API 几乎总是更便宜;持续高用量时本地开始占优——一张 1100 美元的二手 3090 只有在你的 API 月账单超过硬件摊销加电费时才能回本。
本地推理的电费要多少?
按 GPU 平均 50% 负载估算,一张 350W 的卡按 $0.15/kWh 电价每月约 $19。相比硬件摊销,电费占比很小。
为什么这个计算器里只有部分模型?
我们只把本地模型与「同一模型」的托管 API 对比——这是唯一同口径的比较。拿本地 70B 去对比闭源前沿模型是质量对比,不是成本对比。
API 侧的 token 单价是怎么算的?
取该模型所有托管 API 中最便宜的一家,按输入:输出 = 3:1 加权(0.75×输入价 + 0.25×输出价)。以 Llama 3.1 8B 为例,最便宜的托管 API 为每百万 token $0.02/$0.05,加权后 10M token 每月约 $0.28。缓存命中折扣与峰谷价未计入。

相关阅读