模型库 / Mistral Small 3.2 24B
Mistral Small 3.2 24B 显存需求与显卡搭配
Mistral Small 3.2 24B 是 24GB 单卡甜点位的欧洲答案:24B 稠密参数、40 层、8 KV 头、Apache-2.0 协议、原生 128K 上下文,还自带视觉编码器能读图。它对标的是“一张 24GB 卡能装下的最强稠密模型”:Q4_K_M @8K 总需求约 17.5GB,RTX 3090/4090 宽裕,Q6_K(约 22.6GB)勉强也装得下;16GB 显卡则只能降到 Q3。
横向对比:相比 Gemma 3 27B,它参数更小、KV 更省(8K 约 1.3GB vs 4.2GB)、协议更自由;相比 Qwen3 30B-A3B,它是稠密架构——每 token 要读全部约 14.7GB 权重,4090 理论约 51 tok/s,只有对方四分之一左右,但稠密模型在知识一致性上的口碑更好。通用聊天、多语言、轻量视觉任务都合适,是 24GB 卡的默认推荐。
架构规格
| 总参数 | 24B |
| 激活参数 | 24B |
| 层数 | 40 |
| KV 头数 | 8 |
| Head 维度 | 128 |
| 原生上下文 | 128K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 160.0 KB |
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 25.5 GB | 28.4 GB |
| Q6_K | 19.7 GB | 22.6 GB |
| Q4_K_M | 14.7 GB | 17.5 GB |
| Q3_K_M | 12.0 GB | 14.8 GB |
| Q2_K | 9.5 GB | 12.4 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| RTX 3090 | 24.0 GB | 宽裕 | Q6_K | ≈36 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 需要多卡 | Q3_K_M | ≈42 tok/s | 试算 → |
| RTX 4090 | 24.0 GB | 宽裕 | Q6_K | ≈38 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | Q8_0 | ≈53 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | Q8_0 | ≈23 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈32 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈52 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 宽裕 | Q6_K | ≈37 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | Q8_0 | ≈8 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | Q8_0 | ≈16 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈13 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- 24GB 显卡跑 Mistral Small 24B 选什么量化?
- Q4_K_M(约 17.5GB)宽裕且是甜点;追求质量可上 Q6_K(约 22.6GB),勉强装下、余量约 1.5GB;Q8_0(约 28.4GB)单卡装不下。
- 16GB 显卡能跑 Mistral Small 24B 吗?
- 不能装 Q4。Q3_K_M 约 14.8GB 勉强可行,但 24B 在 Q3 下质量损失明显;16GB 卡更合理的正解是 gpt-oss-20b(MoE,Q4_K_M 约 14.7GB 宽裕)。
- Mistral Small 24B 和 Gemma 3 27B 怎么选?
- 要自由协议、省显存、留长上下文余量选 Mistral;要 Google 系英语质量与指令遵循选 Gemma,但接受 24GB 卡上勉强装下、KV 更吃显存。
相关指南
在显卡兼容性查询工具中试算 Mistral Small 3.2 24B →
数据核实于 2026-09-01