GPUFits

模型库 / Mistral Small 3.2 24B

Mistral Small 3.2 24B 显存需求与显卡搭配

Mistral Small 3.2 24B 是 24GB 单卡甜点位的欧洲答案:24B 稠密参数、40 层、8 KV 头、Apache-2.0 协议、原生 128K 上下文,还自带视觉编码器能读图。它对标的是“一张 24GB 卡能装下的最强稠密模型”:Q4_K_M @8K 总需求约 17.5GB,RTX 3090/4090 宽裕,Q6_K(约 22.6GB)勉强也装得下;16GB 显卡则只能降到 Q3。

横向对比:相比 Gemma 3 27B,它参数更小、KV 更省(8K 约 1.3GB vs 4.2GB)、协议更自由;相比 Qwen3 30B-A3B,它是稠密架构——每 token 要读全部约 14.7GB 权重,4090 理论约 51 tok/s,只有对方四分之一左右,但稠密模型在知识一致性上的口碑更好。通用聊天、多语言、轻量视觉任务都合适,是 24GB 卡的默认推荐。

架构规格

总参数24B
激活参数 24B
层数40
KV 头数 8
Head 维度128
原生上下文128K
开源协议apache-2.0
每 token KV 字节数(fp16)160.0 KB

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 25.5 GB 28.4 GB
Q6_K 19.7 GB 22.6 GB
Q4_K_M 14.7 GB 17.5 GB
Q3_K_M 12.0 GB 14.8 GB
Q2_K 9.5 GB 12.4 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 需 2 张 试算 →
RTX 3090 24.0 GB 宽裕 Q6_K ≈36 tok/s 试算 →
RTX 4070 Ti Super 16.0 GB 需要多卡 Q3_K_M ≈42 tok/s 试算 →
RTX 4090 24.0 GB 宽裕 Q6_K ≈38 tok/s 试算 →
RTX 5090 32.0 GB 宽裕 Q8_0 ≈53 tok/s 试算 →
RTX A6000 48.0 GB 宽裕 Q8_0 ≈23 tok/s 试算 →
A100 80GB 80.0 GB 宽裕 FP16 ≈32 tok/s 试算 →
H100 80GB 80.0 GB 宽裕 FP16 ≈52 tok/s 试算 →
RX 7900 XTX 24.0 GB 宽裕 Q6_K ≈37 tok/s 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 宽裕 Q8_0 ≈8 tok/s 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 宽裕 Q8_0 ≈16 tok/s 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 宽裕 FP16 ≈13 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

24GB 显卡跑 Mistral Small 24B 选什么量化?
Q4_K_M(约 17.5GB)宽裕且是甜点;追求质量可上 Q6_K(约 22.6GB),勉强装下、余量约 1.5GB;Q8_0(约 28.4GB)单卡装不下。
16GB 显卡能跑 Mistral Small 24B 吗?
不能装 Q4。Q3_K_M 约 14.8GB 勉强可行,但 24B 在 Q3 下质量损失明显;16GB 卡更合理的正解是 gpt-oss-20b(MoE,Q4_K_M 约 14.7GB 宽裕)。
Mistral Small 24B 和 Gemma 3 27B 怎么选?
要自由协议、省显存、留长上下文余量选 Mistral;要 Google 系英语质量与指令遵循选 Gemma,但接受 24GB 卡上勉强装下、KV 更吃显存。

相关指南

在显卡兼容性查询工具中试算 Mistral Small 3.2 24B →

数据核实于 2026-09-01