显卡库 / RTX 3060 12GB
RTX 3060 12GB 跑本地 LLM:能跑什么模型、速度多快
RTX 3060 12GB 是本地 LLM 的最低合理入场券,也是 DRAM 涨价潮的受益者——二手价从 2026 年 7 月的 $170-220 涨到 8 月的 $250-275(约 +40%),NVIDIA 甚至在 2026 年以 $339 重新上架零售。12GB 显存、360 GB/s 带宽的定位清晰:8B 模型 Q4 宽裕(约 7.5GB)、理论约 55 tok/s;14B 的 Phi-4(约 12.2GB)已装不下,24B 以上全部出局。
它的真正价值是“试错成本最低的 LLM 显卡”:TDP 170W 不用换电源,矿卡风险低于 30 系高端(12GB 版挖矿效率差),新手第一张卡买它不会后悔。瓶颈同样明确:360 GB/s 带宽跑 8B 以上模型就开始肉,别指望它跑 24B。预算允许直接上二手 3090;预算卡死,它就是起点。二手验机注意显存温度与风扇异响即可,这一代没有 12VHPWR 之类的坑。
规格
| 标称显存 | 12 GB |
| 可用显存(模型可用) | 12.0 GB |
| 显存带宽 | 360 GB/s |
| 类型 | 独显 |
| 发布年份 | 2021 |
| MSRP | $329 |
| 二手参考价 | $260较上月 +44% |
| TDP | 170 W |
性价比指标
每美元带宽
1.38 GB/s/$
每美元可用显存
0.046 GB/$
按 二手参考价 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈42 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | Q8_0 | ≈32 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | Q8_0 | ≈31 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 需要多卡 | Q3_K_M | ≈37 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Gemma 3 27B | 22.4 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Qwen3.8 27B | 20.7 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| Qwen3 32B | 23.7 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| gpt-oss-20b | 14.7 GB | 本地不可行 | Q2_K | ≈189 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 本地不可行 | 需 4 张 | — | 试算 → |
| gpt-oss-120b | 73.6 GB | 本地不可行 | — | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- RTX 3060 12GB 能跑什么模型?
- Q4_K_M @8K 口径:8B 档(Llama 3.1 8B / Qwen3 8B,约 7.5-7.7GB)宽裕;Phi-4 14B(约 12.2GB)装不下;更大的模型全部需要多卡或放弃。
- RTX 3060 12GB 跑 8B 有多快?
- 理论约 55 tok/s(360 GB/s × 0.75 ÷ 4.9GB 每 token 权重)。日常聊天流畅,长上下文预填充明显偏慢。
- 现在还值得买 RTX 3060 12GB 吗?
- 预算卡死在 $300 以内值得:它是全新能买到的最便宜 12GB。能加到 $1,100 左右,二手 3090(24GB/936 GB/s)的 LLM 价值是它的三倍以上。
相关指南
数据核实于 2026-09-01