显卡库 / Mac Studio M5 Ultra (96GB)
Mac Studio M5 Ultra (96GB) 跑本地 LLM:能跑什么模型、速度多快
Mac Studio M5 Ultra 96GB 是 2026 年 8 月 25 日发布、9 月 22 日上市的苹果新旗舰:1.2TB/s 统一内存带宽——Apple 史上最高,比 M3 Ultra 高 50%,起售价 $5,499 只比调价后的 M3 Ultra 贵 $200。可用显存同样约 72GB:gpt-oss-120b Q4(约 73.6GB)仍差一口气、Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕;但只要装得下,都快上一半——gpt-oss-120b 理论约 288 tok/s、稠密 70B 约 21 tok/s。
选型焦点在 96GB Ultra 与 128GB M5 Max(614GB/s)之间:模型工作集在 72GB 以内就选 Ultra 拿带宽,85-100GB 才考虑 128GB Max。256GB 版 Ultra(+约 $4,000)才是真正改变大模型格局的档位——Qwen3.8-Flash-Next Q4(约 112.6GB)宽裕、GLM-5.3-Flash 3-bit(约 129GB)宽裕;512GB 版 10 月下旬才发售。此外最多四台 Mac Studio 可经 Thunderbolt 5 池化内存。tdpW 为整机估算值。
规格
| 标称显存 | 96 GB |
| 可用显存(模型可用) | 72.0 GB |
| 显存带宽 | 1200 GB/s |
| 类型 | 统一内存 |
| 发布年份 | 2026 |
| MSRP | $5,499 |
| TDP | 140 W |
Apple 统一内存按 75% 折算为模型可用显存(其余供系统/显示)。
性价比指标
按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈140 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈56 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈55 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | FP16 | ≈31 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | FP16 | ≈19 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 宽裕 | FP16 | ≈16 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 宽裕 | FP16 | ≈16 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 宽裕 | FP16 | ≈15 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 宽裕 | FP16 | ≈136 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 宽裕 | FP16 | ≈14 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | FP16 | ≈125 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 宽裕 | Q6_K | ≈16 tok/s | 试算 → |
| gpt-oss-120b | 73.6 GB | 需要多卡 | Q3_K_M | ≈353 tok/s | 试算 → |
| Qwen3.8 Flash-Next | 112.6 GB | 本地不可行 | 需 2 张 | — | 试算 → |
| GLM-5.3-Flash | 198.7 GB | 本地不可行 | 需 3 张 | — | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- Mac Studio M5 Ultra 96GB 能跑什么模型?
- 可用约 72GB,容量结论与 M3 Ultra 相同:gpt-oss-120b Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕、其余全部宽裕;Q4 口径 gpt-oss-120b(73.6GB)差 1.6GB。差别全在速度:1.2TB/s 让能装下的模型都快约 50%。
- 96GB M5 Ultra 还是 128GB M5 Max?
- 目标模型在 72GB 可用以内:选 Ultra,1.2TB/s 对 614GB/s 接近翻倍;真实工作集在 85-100GB(如 80-90GB 模型文件):才选 128GB Max——带宽救不了装不下的权重。119GB 级 Q4 模型两者都不行,需 256GB Ultra。
- 比 M3 Ultra 贵 $200 值吗?
- 值。本地 LLM 生成是带宽瓶颈,1.2TB/s vs 819GB/s 直接转化为约 +50% tok/s;且 M5 Ultra 每 GPU 核带 Neural Accelerator,长 prompt 预处理更快。唯一选 M3 Ultra 的理由是二手/折价渠道明显便宜。
相关指南
在显卡兼容性查询工具中试算 Mac Studio M5 Ultra (96GB) →
数据核实于 2026-10-01