GPUFits

显卡库 / RX 7900 XTX

RX 7900 XTX 跑本地 LLM:能跑什么模型、速度多快

RX 7900 XTX 是 24GB 显存的预算捷径:960 GB/s 带宽纸面强于 3090,二手仅约 $600-700——同容量 N 卡的一半。它跑 8B Q4 理论约 150 tok/s,与 4090 同级:llama.cpp 的 GGUF 推理对 CUDA 专有特性依赖不深,带宽利用率上 A 卡并不吃亏。

代价是生态:ROCm 在 Linux 下已可用,llama.cpp 有 Vulkan 后端保底,但 Windows 支持、部分框架的 kernel 优化、多卡支持都明显弱于 CUDA——遇到问题你得自己翻 GitHub issue。画像:Linux 用户、愿意折腾、预算敏感、单卡 24B 档需求(24B Q4 宽裕、32B 勉强,与 3090 完全同档)。不建议作为“第一张 LLM 卡”买给不想折腾的人:N 卡的溢价买的是生态确定性,对很多人这钱花得值。

规格

标称显存24 GB
可用显存(模型可用)24.0 GB
显存带宽960 GB/s
类型独显
发布年份2022
MSRP$999
二手参考价$650
TDP355 W

性价比指标

每美元带宽
1.48 GB/s/$
每美元可用显存
0.037 GB/$

按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈112 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈45 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈44 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 Q8_0 ≈46 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 Q6_K ≈37 tok/s 试算 →
Gemma 3 27B 22.4 GB 勉强装下 Q4_K_M ≈43 tok/s 试算 →
Qwen3.8 27B 20.7 GB 勉强装下 Q5_K_M ≈36 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 勉强装下 Q5_K_M ≈34 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 勉强装下 Q4_K_M ≈356 tok/s 试算 →
Qwen3 32B 23.7 GB 勉强装下 Q4_K_M ≈36 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 Q6_K ≈244 tok/s 试算 →
Llama 3.3 70B 47.4 GB 本地不可行 需 2 张 试算 →
gpt-oss-120b 73.6 GB 本地不可行 需 4 张 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

RX 7900 XTX 能跑什么模型?
显存口径与 3090 完全相同(24GB):24B 档宽裕、Qwen3 32B 勉强(约 23.7GB)、70B 需双卡(但 A 卡多卡生态弱,不建议)。带宽 960 GB/s 理论速度还略胜 3090。
AMD 卡跑 llama.cpp 体验如何?
Linux 下 ROCm 与 Vulkan 后端都可用,GGUF 推理速度接近理论值;Windows 与部分框架(vLLM 等)支持弱一档。折腾能力是把 $650 变成 24GB 的前提。
7900 XTX 和 3090 怎么选?
Linux + 愿折腾 + 预算敏感:7900 XTX,一半的价钱、相同的 24GB、更高的带宽。要生态确定性、CUDA 框架全覆盖、将来组多卡:3090。

相关指南

在显卡兼容性查询工具中试算 RX 7900 XTX →

数据核实于 2026-09-01