配置生成器
输入预算和目标模型,自动生成预算内最便宜的可行配置单:显卡与数量、量化档、显存明细、理论速度、电费估算与 llama.cpp 启动命令。
推荐配置
RTX 3060 12GB
- 数量
- 1 张
- 单价
- $260 二手
- 合计
- $260
- 推荐量化档
- Q4_K_M
- 理论速度
- ~137 tok/s
- 估算月电费
- $9.18
显存占用
按 8K 上下文、fp16 KV、1.5GB 运行时开销估算
- 权重
- 2.0 GB
- KV 缓存
- 0.9 GB
- 运行时开销
- 1.5 GB
- 合计需求
- 4.4 GB
- 可用显存
- 12 GB
理论估算 ±30%,实际受框架、驱动与 CPU 影响 · 电费按 TDP × 50% 负载 × 720h × $0.15/kWh 估算
llama.cpp 启动命令
llama-server -m llama-3.2-3b-Q4_K_M.gguf -ngl 99 -c 8192备选方案
RX 7900 XTX
更快- 数量
- 1 张
- 单价
- $650 二手
- 合计
- $650
- 推荐量化档
- Q4_K_M
- 理论速度
- ~366 tok/s
- 估算月电费
- $19.17
理论估算值:速度误差 ±30%;价格为人工维护参考价(有二手价按二手价);电费按平均 50% 负载估算。
这个生成器怎么用
- 拖预算滑块或直接输入金额($200–$20,000)。预算指显卡/整机的硬件支出,不含显示器、电源等外设。
- 选目标模型。列表覆盖站内全部 14 个模型,含 MoE(显存按总参数算)与 DeepSeek-R1(MLA 口径)。
- 读配置单。推荐方案给出显卡型号与数量、单价与总价、推荐量化档、显存占用明细(权重/KV/开销 vs 可用)、理论速度与估算月电费,并附可直接改的 llama.cpp 启动命令。
- (可选)填每月用量。填入 M tokens 后,配置单会多显示一行「每 M tokens 电费」,方便和 API 定价对账。
推荐逻辑的判定顺序
生成器不是穷举所有组合,而是按一条固定顺序找「预算内最便宜」的方案:先在 Q4_K_M(8K 上下文、fp16 KV)下扫描——单卡能舒适或紧张装下的卡按价格升序取第一张;单卡都不行时,对每张独显试同型号 2–4 卡(可用显存直接相加、不打折),取总价最低且 ≤ 预算的组合。Q4_K_M 整档无解才降到 Q3_K_M,再不行降到 Q2_K。三档都装不下时给出「预算不足」结论,并提供更小模型列表与云 GPU 租用入口。紧张的 Q4 优于舒适的 Q3——质量损失比显存余量更影响体验,这条规则与兼容性查询器一致。
Mac 统一内存机型先按标称 × 0.75 折算可用显存再参与判定,且不参与多卡;A100/H100 这类高价卡在低预算下自然被价格门槛过滤。备选方案区会给出一到两个对照项:「更便宜」通常是降一档量化的同卡或更低档卡,「更快」是预算内速度更高的组合,方便你在价格与速度之间权衡。
配置单里每个数字的口径
显存明细 = 权重(参数 × 量化 bpw ÷ 8,bpw 取实测 GGUF 文件反推值)+ KV 缓存(GQA 或 MLA 公式,fp16)+ 1.5GB 运行时开销;可用显存独显取标称值、Mac 取标称 × 0.75。理论速度 = 显存带宽 × 0.75 ÷ 每 token 权重读取量,多卡再吃 0.85 带宽惩罚,标注 ±30% 误差。电费 = TDP × 50% 平均负载 × 720h × $0.15/kWh,与成本对比器同口径;价格为人工维护的参考价,有二手价按二手价。llama.cpp 命令示例默认 -ngl 99 全量卸载到 GPU,多卡方案附 --split-mode layer 按层拆分。
常见问题
- 配置生成器是怎么挑显卡的?
- 固定 8K 上下文、fp16 KV,先按 Q4_K_M 找预算内能装下模型的最便宜方案:单卡优先,单卡装不下再试同型号 2–4 卡;整档都不行再降到 Q3_K_M、Q2_K 重试。三档都装不下则判定预算不足。
- 1500 美元预算能跑什么级别的模型?
- 按当前参考价,$1500 可以拿下二手 RTX 3090(24GB,约 $1100),Q4_K_M 下舒适运行 Llama 3.1 8B、Qwen3 8B,紧张运行 27B–32B 档模型;跑 70B 需要约 $3000 起步的双卡方案。
- 为什么推荐单卡而不是多卡?
- 同预算下单卡省电、省心、不吃 0.85 的多卡带宽惩罚。只有单卡装不下目标模型时才推荐同型号 2–4 卡,多卡可用显存直接相加不打折。Mac 统一内存机型不参与多卡方案。
- 估算的电费准吗?
- 按 TDP × 50% 平均负载 × 720 小时 × $0.15/kWh 估算,与站内成本对比器同口径。推理是间歇负载,实际电费通常低于该估算;填入每月用量还能看到每百万 token 的电费分摊。