GPUFits

显卡兼容性查询器

双向显卡兼容性查询:选模型查能跑它的显卡(单卡或多卡组合),或选显卡查能跑它的模型,附理论速度估算与多卡方案,覆盖 14 个主流模型与 12 张热门显卡的实算数据。

显卡兼容性查询器
3.9GB
Llama 3.2 3.21B · Q4_K_M · 4K
  • rtx-3060-12gb✅ 舒适
    3.9 / 12 GB
    ~137 tok/s$260 二手
  • rx-7900-xtx✅ 舒适
    3.9 / 24 GB
    ~366 tok/s$650 二手
  • rtx-4070-ti-super✅ 舒适
    3.9 / 16 GB
    ~256 tok/s$760 二手
  • rtx-3090✅ 舒适
    3.9 / 24 GB
    ~357 tok/s$1,100 二手
  • mac-mini-m4-pro-48gb✅ 舒适
    3.9 / 36 GB
    ~104 tok/s$1,799 首发价
  • rtx-5090✅ 舒适
    3.9 / 32 GB
    ~684 tok/s$1,999 首发价
  • rtx-4090✅ 舒适
    3.9 / 24 GB
    ~385 tok/s$2,400 二手
  • rtx-a6000✅ 舒适
    3.9 / 48 GB
    ~293 tok/s$2,800 二手
  • mac-studio-m4-max-64gb✅ 舒适
    3.9 / 48 GB
    ~208 tok/s$2,899 首发价
  • mac-studio-m3-ultra-96gb✅ 舒适
    3.9 / 72 GB
    ~312 tok/s$5,299 首发价
  • a100-80gb✅ 舒适
    3.9 / 80 GB
    ~778 tok/s$15,000 首发价
  • h100-80gb✅ 舒适
    3.9 / 80 GB
    ~1278 tok/s$30,000 首发价

理论估算值,实际速度受框架、驱动与 CPU 影响,误差 ±30%。价格为人工维护的参考价,标注核实日期。

这个查询器怎么用

工具支持两个方向,顶部切换:

  1. 按模型查显卡。选定模型、量化档和上下文长度后,表格逐卡列出判定、理论速度和参考价格(有二手价按二手价)。单卡装不下的型号会附同型号多卡方案:最小可行卡数(2–4 张)、合计可用显存、合计价格与速度。
  2. 按显卡查模型。选定显卡和卡数后,逐模型列出能否运行、推荐量化档与理论速度。推荐档的规则是从精度最高档往下找第一个「舒适」或「紧张」的档位——紧张的 Q4 优于舒适的 Q2,质量损失比显存余量更影响体验。
  3. 读速度时保留余量。tok/s 数字按 显存带宽 × 0.75 ÷ 每 token 权重 估算,为理论上限,实际受框架、驱动、CPU 影响,误差 ±30%。

四档判定分别意味着什么

舒适(需求 ≤ 可用显存 80%)

有余量拉长上下文、开更大的 batch,或同时跑浏览器等其他程序。选购时尽量落在这一档。

紧张(需求 ≤ 可用显存 100%)

能跑,但几乎没有余量。再拉上下文、KV 不量化或系统占显存偏高都可能 OOM,适合预算卡死时接受。

需要多卡(需求 ≤ 可用显存 120%)

单卡装不下,但同型号 2 卡(可用显存直接相加)可以覆盖。注意速度吃 0.85 的多卡带宽惩罚。

不可行(需求 > 可用显存 120%)

4 张同型号卡也装不下。换更低的量化档、换更小的模型,或改用云 GPU。

多卡与云 GPU 兜底

同型号多卡的可用显存直接相加、不打折——2×24GB 就按 48GB 判定;代价是推理速度按合计带宽 × 0.85 估算,混插不同型号则按最慢卡的带宽算。Mac 统一内存机型先按标称 × 0.75 折算可用值再参与判定。单卡与多卡都装不下时,页面会显示云 GPU 租用入口:按小时计费,适合偶发跑一次大模型、不值得买硬件的场景。

MoE 模型的特殊口径

MoE(混合专家)模型的显存与速度按两套参数算:显存按总参数——所有专家必须同时装进显存,Qwen3-30B-A3B 要按 30.5B 全量算显存;速度按激活参数——每 token 只读取激活的 3.3B 权重,所以它在 RTX 4090 上的理论速度接近一个稠密 3B 模型,而不是 30B 模型。看到「30B 总参数、3B 激活」的型号跑出三位数 tok/s 的估算值,不是 bug。

常见问题

RTX 4090 能跑 Llama 70B 吗?
单卡不行——Llama 3.3 70B 在 Q4_K_M 下约需 47GB,接近 4090 24GB 的两倍。双 4090(48GB)可以约 30 tok/s 紧张运行(理论估算 ±30%);单张 RTX 5090(32GB)也不够。
跑 32B 模型需要什么显卡?
32B 模型在 Q4_K_M、8K 上下文下约需 24GB——RTX 4090/3090 属紧张档位,RTX 5090 或任意 48GB 卡可舒适运行。
Mac 适合跑本地大模型吗?
容量上适合:统一内存让 96GB Mac Studio 装下消费级显卡装不下的模型。速度上每美元不如 NVIDIA——Mac Studio M3 Ultra 跑 70B Q4 约 10-15 tok/s。
判定为「需要多卡」或「不可行」时怎么办?
工具会给出同型号 2–4 卡的最小可行方案:多卡可用显存直接相加、不打折,速度按合计带宽 ×0.85 估算(理论估算 ±30%)。4 卡仍装不下时,建议改用云 GPU 按小时租用,页面会显示租用入口。

相关阅读