模型库 / Qwen3.8 27B
Qwen3.8 27B 显存需求与显卡搭配
Qwen3.8 27B(2026 年 8 月发布)是本列表里架构最激进的模型:64 层中只有 16 层是标准 full attention(24 Q 头/4 KV 头/headDim 256,每 4 层一层),其余 48 层是 Gated DeltaNet 线性注意力——KV 占用与上下文长度无关,这让它原生支持 256K 上下文而显存几乎不涨。Apache-2.0 协议,参数量含视觉编码器。
硬件账要分两本算:权重部分 Q4_K_M 约 17GB,24GB 卡勉强装下(总量约 20.7GB);KV 部分本站按标准 GQA 公式显示约 2.1GB@8K,但实际只有 full attention 层产生常规 KV,公式高估约 4 倍——也就是说它在长上下文下的真实可行性比本站矩阵判定更好。线性注意力的代价是长程精确检索(大海捞针测试)略弱于全注意力,但日常 RAG 与超长文档摘要完全够用。想要 27B 级质量又要超长上下文,它目前是唯一解。
架构规格
| 总参数 | 27.8B |
| 激活参数 | 27.8B |
| 层数 | 64 |
| KV 头数 | 4 |
| Head 维度 | 256 |
| 原生上下文 | 256K |
| 开源协议 | apache-2.0 |
| 每 token KV 字节数(fp16) | 256.0 KB |
混合架构提示:64 层中仅 16 层为 full attention,其余 48 层 Gated DeltaNet 线性注意力的 KV 与上下文长度无关——上表按标准 GQA 公式计算,KV 高估约 4 倍,长上下文实际更乐观。
量化档显存需求(@8K 上下文,fp16 KV)
| 量化档 | 权重 | 总需求(含 1.5GB 运行时开销) |
|---|---|---|
| Q8_0 | 29.6 GB | 33.2 GB |
| Q6_K | 22.8 GB | 26.5 GB |
| Q4_K_M | 17.0 GB | 20.7 GB |
| Q3_K_M | 13.9 GB | 17.5 GB |
| Q2_K | 11.0 GB | 14.7 GB |
KV 缓存与运行时开销不随量化档变化;更长上下文按 KV 部分线性增加,可用显卡兼容性查询工具调整上下文长度。
显卡判定矩阵(Q4_K_M @8K)
| 显卡 | 可用显存 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| RTX 3060 12GB | 12.0 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| RTX 3090 | 24.0 GB | 勉强装下 | Q5_K_M | ≈35 tok/s | 试算 → |
| RTX 4070 Ti Super | 16.0 GB | 本地不可行 | Q2_K | ≈46 tok/s | 试算 → |
| RTX 4090 | 24.0 GB | 勉强装下 | Q5_K_M | ≈38 tok/s | 试算 → |
| RTX 5090 | 32.0 GB | 宽裕 | Q6_K | ≈59 tok/s | 试算 → |
| RTX A6000 | 48.0 GB | 宽裕 | Q8_0 | ≈19 tok/s | 试算 → |
| A100 80GB | 80.0 GB | 宽裕 | FP16 | ≈28 tok/s | 试算 → |
| H100 80GB | 80.0 GB | 宽裕 | FP16 | ≈45 tok/s | 试算 → |
| RX 7900 XTX | 24.0 GB | 勉强装下 | Q5_K_M | ≈36 tok/s | 试算 → |
| Mac mini M4 Pro (48GB) | 36.0 GB | 宽裕 | Q8_0 | ≈7 tok/s | 试算 → |
| Mac Studio M4 Max (64GB) | 48.0 GB | 宽裕 | Q8_0 | ≈14 tok/s | 试算 → |
| Mac Studio M3 Ultra (96GB) | 72.0 GB | 宽裕 | FP16 | ≈11 tok/s | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- Qwen3.8 27B 需要多少显存?
- Q4_K_M @8K 约 20.7GB,24GB 显卡勉强装下;得益于线性注意力,拉到 256K 全长上下文 KV 增量远小于标准架构,这是它与 Gemma 3 27B 的本质区别。
- 什么是 Gated DeltaNet 线性注意力?
- 一种 KV 占用与上下文长度无关的注意力变体:Qwen3.8 27B 每 4 层中 3 层用它、1 层用标准注意力。长上下文显存压力大幅降低,代价是超长距离的精确引用能力略弱。
- Qwen3.8 27B 和 Gemma 3 27B 怎么选?
- 要超长上下文(256K)、低 KV 显存、Apache-2.0 协议选 Qwen3.8;要全注意力架构的长程精确检索与 Google 系英语质量选 Gemma,但接受 24GB 卡上勉强和长上下文爆显存。
相关指南
数据核实于 2026-09-01