GPUFits

显卡库 / RTX 4070 Ti Super

RTX 4070 Ti Super 跑本地 LLM:能跑什么模型、速度多快

RTX 4070 Ti Super 是 16GB 档的尴尬优等生:672 GB/s 带宽比 3090 低 28%,但 285W TDP、2024 年 1 月发布、二手约 $720-800(eBay 追踪约 $700),是少数“基本无矿”的大显存 N 卡。16GB 的甜点与天花板都很清楚:8B 模型上到 Q8_0(约 11.4GB)都宽裕,gpt-oss-20b Q4(约 14.7GB)勉强装下,Phi-4 Q4(约 12.2GB)宽裕;但 24B 级全部出局。

这是它与 24GB 卡之间无法跨越的鸿沟——16GB 与 24GB 的差距不是 50%,而是“能跑 32B 与不能”的质变。适合人群:主需求是游戏/创作、LLM 是副需求且目标锁定 8-20B 档;或对矿卡零容忍的买家。如果 LLM 是主用途,同价位二手 3090 的 24GB 显存价值更高。16GB 卡受显存涨价推动近期上行,买前比价。

规格

标称显存16 GB
可用显存(模型可用)16.0 GB
显存带宽672 GB/s
类型独显
发布年份2024
MSRP$799
二手参考价$760较上月 +38%
TDP285 W

性价比指标

每美元带宽
0.88 GB/s/$
每美元可用显存
0.021 GB/$

按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈79 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 Q8_0 ≈59 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 Q8_0 ≈58 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 Q6_K ≈42 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 需要多卡 Q3_K_M ≈42 tok/s 试算 →
Gemma 3 27B 22.4 GB 本地不可行 需 2 张 试算 →
Qwen3.8 27B 20.7 GB 本地不可行 Q2_K ≈46 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 本地不可行 Q2_K ≈43 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 本地不可行 Q2_K ≈385 tok/s 试算 →
Qwen3 32B 23.7 GB 本地不可行 需 2 张 试算 →
gpt-oss-20b 14.7 GB 勉强装下 Q4_K_M ≈229 tok/s 试算 →
Llama 3.3 70B 47.4 GB 本地不可行 需 3 张 试算 →
gpt-oss-120b 73.6 GB 本地不可行 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

RTX 4070 Ti Super 16GB 能跑什么模型?
Q4 口径:8B 档宽裕到可以上 Q8_0;Phi-4 14B 宽裕、gpt-oss-20b 勉强;24B 级(Mistral Small/Gemma 3)全部装不下,这是 16GB 的硬顶。
16GB 跑本地 LLM 够用吗?
取决于目标档位:8-14B 日常用够,还能上高量化;但 24GB 才能碰 24-32B 档——这是容量断层,不是性能差距。主玩 LLM 建议直接 24GB。
4070 Ti Super 和二手 3090 怎么选?
主玩 LLM 选 3090(24GB 决定模型档位);主玩游戏/创作、顺带 LLM、或拒绝矿卡风险选 4070 Ti Super(2024 年卡,基本无矿,功耗低 65W)。

相关指南

在显卡兼容性查询工具中试算 RTX 4070 Ti Super →

数据核实于 2026-09-01