显卡库 / RX 7900 XTX
RX 7900 XTX 跑本地 LLM:能跑什么模型、速度多快
RX 7900 XTX 是 24GB 显存的预算捷径:960 GB/s 带宽纸面强于 3090,二手仅约 $600-700——同容量 N 卡的一半。它跑 8B Q4 理论约 150 tok/s,与 4090 同级:llama.cpp 的 GGUF 推理对 CUDA 专有特性依赖不深,带宽利用率上 A 卡并不吃亏。
代价是生态:ROCm 在 Linux 下已可用,llama.cpp 有 Vulkan 后端保底,但 Windows 支持、部分框架的 kernel 优化、多卡支持都明显弱于 CUDA——遇到问题你得自己翻 GitHub issue。画像:Linux 用户、愿意折腾、预算敏感、单卡 24B 档需求(24B Q4 宽裕、32B 勉强,与 3090 完全同档)。不建议作为“第一张 LLM 卡”买给不想折腾的人:N 卡的溢价买的是生态确定性,对很多人这钱花得值。
规格
| 标称显存 | 24 GB |
| 可用显存(模型可用) | 24.0 GB |
| 显存带宽 | 960 GB/s |
| 类型 | 独显 |
| 发布年份 | 2022 |
| MSRP | $999 |
| 二手参考价 | $650 |
| TDP | 355 W |
性价比指标
每美元带宽
1.48 GB/s/$
每美元可用显存
0.037 GB/$
按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈112 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈45 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈44 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | Q8_0 | ≈46 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | Q6_K | ≈37 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 勉强装下 | Q4_K_M | ≈43 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 勉强装下 | Q5_K_M | ≈36 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 勉强装下 | Q5_K_M | ≈34 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 勉强装下 | Q4_K_M | ≈356 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 勉强装下 | Q4_K_M | ≈36 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | Q6_K | ≈244 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RX 7900 XTX 能跑什么模型?
- 显存口径与 3090 完全相同(24GB):24B 档宽裕、Qwen3 32B 勉强(约 23.7GB)、70B 需双卡(但 A 卡多卡生态弱,不建议)。带宽 960 GB/s 理论速度还略胜 3090。
- AMD 卡跑 llama.cpp 体验如何?
- Linux 下 ROCm 与 Vulkan 后端都可用,GGUF 推理速度接近理论值;Windows 与部分框架(vLLM 等)支持弱一档。折腾能力是把 $650 变成 24GB 的前提。
- 7900 XTX 和 3090 怎么选?
- Linux + 愿折腾 + 预算敏感:7900 XTX,一半的价钱、相同的 24GB、更高的带宽。要生态确定性、CUDA 框架全覆盖、将来组多卡:3090。
相关指南
数据核实于 2026-09-01