GPUFits

配置生成器

输入预算和目标模型,自动生成预算内最便宜的可行配置单:显卡与数量、量化档、显存明细、理论速度、电费估算与 llama.cpp 启动命令。

配置生成器

推荐配置

RTX 3060 12GB

数量
1
单价
$260 二手
合计
$260
推荐量化档
Q4_K_M
理论速度
~137 tok/s
估算月电费
$9.18

显存占用

按 8K 上下文、fp16 KV、1.5GB 运行时开销估算

权重
2.0 GB
KV 缓存
0.9 GB
运行时开销
1.5 GB
合计需求
4.4 GB
可用显存
12 GB

理论估算 ±30%,实际受框架、驱动与 CPU 影响 · 电费按 TDP × 50% 负载 × 720h × $0.15/kWh 估算

llama.cpp 启动命令

llama-server -m llama-3.2-3b-Q4_K_M.gguf -ngl 99 -c 8192

备选方案

RX 7900 XTX

更快
数量
1
单价
$650 二手
合计
$650
推荐量化档
Q4_K_M
理论速度
~366 tok/s
估算月电费
$19.17

理论估算值:速度误差 ±30%;价格为人工维护参考价(有二手价按二手价);电费按平均 50% 负载估算。

这个生成器怎么用

  1. 拖预算滑块或直接输入金额($200–$20,000)。预算指显卡/整机的硬件支出,不含显示器、电源等外设。
  2. 选目标模型。列表覆盖站内全部 14 个模型,含 MoE(显存按总参数算)与 DeepSeek-R1(MLA 口径)。
  3. 读配置单。推荐方案给出显卡型号与数量、单价与总价、推荐量化档、显存占用明细(权重/KV/开销 vs 可用)、理论速度与估算月电费,并附可直接改的 llama.cpp 启动命令。
  4. (可选)填每月用量。填入 M tokens 后,配置单会多显示一行「每 M tokens 电费」,方便和 API 定价对账。

推荐逻辑的判定顺序

生成器不是穷举所有组合,而是按一条固定顺序找「预算内最便宜」的方案:先在 Q4_K_M(8K 上下文、fp16 KV)下扫描——单卡能舒适或紧张装下的卡按价格升序取第一张;单卡都不行时,对每张独显试同型号 2–4 卡(可用显存直接相加、不打折),取总价最低且 ≤ 预算的组合。Q4_K_M 整档无解才降到 Q3_K_M,再不行降到 Q2_K。三档都装不下时给出「预算不足」结论,并提供更小模型列表与云 GPU 租用入口。紧张的 Q4 优于舒适的 Q3——质量损失比显存余量更影响体验,这条规则与兼容性查询器一致。

Mac 统一内存机型先按标称 × 0.75 折算可用显存再参与判定,且不参与多卡;A100/H100 这类高价卡在低预算下自然被价格门槛过滤。备选方案区会给出一到两个对照项:「更便宜」通常是降一档量化的同卡或更低档卡,「更快」是预算内速度更高的组合,方便你在价格与速度之间权衡。

配置单里每个数字的口径

显存明细 = 权重(参数 × 量化 bpw ÷ 8,bpw 取实测 GGUF 文件反推值)+ KV 缓存(GQA 或 MLA 公式,fp16)+ 1.5GB 运行时开销;可用显存独显取标称值、Mac 取标称 × 0.75。理论速度 = 显存带宽 × 0.75 ÷ 每 token 权重读取量,多卡再吃 0.85 带宽惩罚,标注 ±30% 误差。电费 = TDP × 50% 平均负载 × 720h × $0.15/kWh,与成本对比器同口径;价格为人工维护的参考价,有二手价按二手价。llama.cpp 命令示例默认 -ngl 99 全量卸载到 GPU,多卡方案附 --split-mode layer 按层拆分。

常见问题

配置生成器是怎么挑显卡的?
固定 8K 上下文、fp16 KV,先按 Q4_K_M 找预算内能装下模型的最便宜方案:单卡优先,单卡装不下再试同型号 2–4 卡;整档都不行再降到 Q3_K_M、Q2_K 重试。三档都装不下则判定预算不足。
1500 美元预算能跑什么级别的模型?
按当前参考价,$1500 可以拿下二手 RTX 3090(24GB,约 $1100),Q4_K_M 下舒适运行 Llama 3.1 8B、Qwen3 8B,紧张运行 27B–32B 档模型;跑 70B 需要约 $3000 起步的双卡方案。
为什么推荐单卡而不是多卡?
同预算下单卡省电、省心、不吃 0.85 的多卡带宽惩罚。只有单卡装不下目标模型时才推荐同型号 2–4 卡,多卡可用显存直接相加不打折。Mac 统一内存机型不参与多卡方案。
估算的电费准吗?
按 TDP × 50% 平均负载 × 720 小时 × $0.15/kWh 估算,与站内成本对比器同口径。推理是间歇负载,实际电费通常低于该估算;填入每月用量还能看到每百万 token 的电费分摊。

相关阅读