GPUFits

模型库 / Muse Glimmer 30B

Muse Glimmer 30B 显存需求与显卡搭配

Muse Glimmer 30B(2026 年 8 月发布)走的是另一条混合路线:52 层中每 4 层有 3 层用 2048 滑窗注意力、1 层全局注意力,且只有 2 组 KV 头——KV 缓存天然极小,8K 下约 0.44GB(本站标准公式对它仍有高估,与 gpt-oss 的滑窗先例同理)。架构含约 1.8B ViT 视觉编码器,原生多模态;Apache-2.0 协议,128K 上下文。

29.6B 参数的 Q4_K_M @8K 总需求约 20.1GB,24GB 单卡勉强装下,32GB 卡可以上 Q6_K;长上下文几乎不产生额外显存压力,这是它对比 Gemma 3 27B 的结构性优势。滑窗为主的代价与 gpt-oss 相同:极长距离的精确引用能力弱于全注意力模型。甜点画像是 24GB 卡上的多模态长文档助手——读 PDF、读截图、长会议纪要;纯文本质量与 Qwen3 32B 互有胜负,但显存与速度都友好得多。

架构规格

总参数29.6B
激活参数 29.6B
层数52
KV 头数 2
Head 维度128
原生上下文128K
开源协议apache-2.0
每 token KV 字节数(fp16)52.0 KB

滑窗提示:3/4 层为 2048 滑窗注意力,上表按标准全注意力公式计算 KV,实际占用更低(参考 gpt-oss 先例),判定偏保守。

量化档显存需求(@8K 上下文,fp16 KV)

量化档 权重 总需求(含 1.5GB 运行时开销)
Q8_0 31.5 GB 33.4 GB
Q6_K 24.3 GB 26.2 GB
Q4_K_M 18.1 GB 20.1 GB
Q3_K_M 14.8 GB 16.7 GB
Q2_K 11.7 GB 13.7 GB

KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。

显卡判定矩阵(Q4_K_M @8K)

显卡 可用显存 判定 推荐量化 理论速度
RTX 3060 12GB 12.0 GB 本地不可行 需 2 张 试算 →
RTX 3090 24.0 GB 勉强装下 Q5_K_M ≈33 tok/s 试算 →
RTX 4070 Ti Super 16.0 GB 本地不可行 Q2_K ≈43 tok/s 试算 →
RTX 4090 24.0 GB 勉强装下 Q5_K_M ≈36 tok/s 试算 →
RTX 5090 32.0 GB 宽裕 Q6_K ≈55 tok/s 试算 →
RTX A6000 48.0 GB 宽裕 Q8_0 ≈18 tok/s 试算 →
A100 80GB 80.0 GB 宽裕 FP16 ≈26 tok/s 试算 →
H100 80GB 80.0 GB 宽裕 FP16 ≈42 tok/s 试算 →
RX 7900 XTX 24.0 GB 勉强装下 Q5_K_M ≈34 tok/s 试算 →
Mac mini M4 Pro (48GB) 36.0 GB 宽裕 Q8_0 ≈7 tok/s 试算 →
Mac Studio M4 Max (64GB) 48.0 GB 宽裕 Q8_0 ≈13 tok/s 试算 →
Mac Studio M3 Ultra (96GB) 72.0 GB 宽裕 FP16 ≈10 tok/s 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

Muse Glimmer 30B 需要多少显存?
Q4_K_M @8K 约 20.1GB,24GB 显卡勉强装下;Q6_K 约 26.2GB 需 32GB 卡。KV 缓存极小(8K 约 0.44GB),长上下文增量远低于全注意力模型。
滑窗注意力会影响质量吗?
对绝大多数任务影响甚微——3/4 层只看最近 2048 token,1/4 层看全局,与 gpt-oss 同款设计经过大规模验证;受影响的是超长距离的精确引用(如“第 3 页和第 180 页的呼应”)。
Muse Glimmer 30B 和 Qwen3 32B 怎么选?
要多模态、长上下文低显存、略快的速度选 Muse Glimmer(2 KV 头 + 滑窗);要纯文本稠密质量与更成熟的 Qwen 生态选 Qwen3 32B,接受更大的 KV 与更慢的 decode。

相关指南

在显卡兼容性查询工具中试算 Muse Glimmer 30B →

数据核实于 2026-09-01