模型库 / Llama 3.2 3B
Llama 3.2 3B 显存需求与显卡搭配
Llama 3.2 3B 是 Meta 面向端侧与入门显卡的小钢炮:3.21B 稠密参数、28 层、8 组 KV 头的标准 GQA 架构,原生支持 128K 上下文。它的价值不在跑分榜首,而在“什么卡都能跑”:Q4_K_M @8K 总需求约 4.4GB,连 8GB 显存的老卡都绰绰有余,RTX 3060 12GB 上理论速度约 137 tok/s,Mac mini M4 Pro 上约 104 tok/s,体感零等待。
代价是推理与知识容量明显弱于 8B 档——多步推理、长链逻辑容易翻车,更适合分类、摘要、结构化抽取、简单问答和 agent 链路里的轻量节点。如果你的卡有 12GB 以上显存,通常没有理由选它而不是 Llama 3.1 8B 或 Qwen3 8B;但显存吃紧、或追求极致响应速度时,它仍是最稳妥的起步模型。量化上 Q4_K_M 是甜点,Q8_0 约 5.9GB,12GB 卡可以无脑上 Q8。注意 llama3.2-community 协议对超大规模商用有额外条款。
架构规格
| 总参数 | 3.21B |
| 激活参数 | 3.21B |
| 层数 | 28 |
| KV 头数 | 8 |
| Head 维度 | 128 |
| 原生上下文 | 128K |
| 开源协议 | llama3.2-community |
| 每 token KV 字节数(fp16) | 112.0 KB |
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 3.4 GB | 5.9 GB |
| Q6_K | 2.6 GB | 5.1 GB |
| Q4_K_M | 2.0 GB | 4.4 GB |
| Q3_K_M | 1.6 GB | 4.0 GB |
| Q2_K | 1.3 GB | 3.7 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 宽裕 | FP16 | ≈42 tok/s | 试算 → |
| RTX 3090 | 24.0 GB | 宽裕 | FP16 | ≈109 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 宽裕 | FP16 | ≈79 tok/s | 试算 → |
| RTX 4090 | 24.0 GB | 宽裕 | FP16 | ≈118 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | FP16 | ≈209 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | FP16 | ≈90 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈238 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈391 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 宽裕 | FP16 | ≈112 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | FP16 | ≈32 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | FP16 | ≈64 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈96 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 8GB 显存能跑 Llama 3.2 3B 吗?
- 能。Q4_K_M @8K 总需求约 4.4GB,即使 Q8_0 也只约 5.9GB,8GB 显卡在 8K 上下文下宽裕;拉到 128K 全长上下文时 KV 缓存会涨到约 15GB,需要降低上下文或量化 KV。
- Llama 3.2 3B 和 Llama 3.1 8B 怎么选?
- 显存 ≥12GB 一律选 8B,质量差距值得那 3GB 显存;只有 8GB 以下显存、或要做高并发轻量任务时才选 3B。
- Llama 3.2 3B 适合什么场景?
- 延迟敏感的轻量任务:文本分类、摘要、关键词抽取、简单客服问答、agent 工作流中的路由节点。复杂推理、代码和数学不是它的强项。
相关指南
数据核实于 2026-09-01