显卡库 / Mac Studio M3 Ultra (96GB)
Mac Studio M3 Ultra (96GB) 跑本地 LLM:能跑什么模型、速度多快
Mac Studio M3 Ultra 96GB 是本地大模型的“准数据中心”:96GB 统一内存可用约 72GB、819 GB/s 带宽,gpt-oss-120b Q4(约 73.6GB)差一口气、Q3_K_M(约 60GB)勉强,70B 可上 Q6_K(约 62GB)宽裕。价格背景必须说清:发售价 $3,999,2026 年 6 月 25 日调价后 $5,299;且 2026 年 3 月起 Apple 因 DRAM 短缺停售 256/512GB 版本——96GB 就是当前能买到的上限,DeepSeek-R1 满血(413GB+)由此在 Apple 单机上彻底无望。
819 GB/s 跑 MoE 模型极快(gpt-oss-120b 理论约 200 tok/s),跑稠密 70B 理论约 14 tok/s——容量有余、带宽中庸是它的准确画像。买家:需要 60-72GB 可用显存、拒绝多卡运维的开发者/小团队。$5,299 的定价让它必须和双卡 4090/A6000 方案认真比价后再出手;若只是 70B Q4 目标,M4 Max 64GB 能省 $2,400。
规格
| 标称显存 | 96 GB |
| 可用显存(模型可用) | 72.0 GB |
| 显存带宽 | 819 GB/s |
| 类型 | 统一内存 |
| 发布年份 | 2025 |
| MSRP | $5,299 |
| TDP | 100 W |
Apple 统一内存按 75% 折算为模型可用显存(其余供系统/显示)。
性价比指标
每美元带宽
0.15 GB/s/$
每美元可用显存
0.014 GB/$
按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。
模型判定矩阵(Q4_K_M @8K)
| 模型 | 显存需求 | 判定 | 推荐量化 | 理论速度 | |
|---|---|---|---|---|---|
| Llama 3.2 3B | 4.4 GB | 宽裕 | FP16 | ≈96 tok/s | 试算 → |
| Llama 3.1 8B | 7.5 GB | 宽裕 | FP16 | ≈38 tok/s | 试算 → |
| Qwen3 8B | 7.7 GB | 宽裕 | FP16 | ≈37 tok/s | 试算 → |
| Phi-4 14B | 12.2 GB | 宽裕 | FP16 | ≈21 tok/s | 试算 → |
| Mistral Small 3.2 24B | 17.5 GB | 宽裕 | FP16 | ≈13 tok/s | 试算 → |
| Gemma 3 27B | 22.4 GB | 宽裕 | FP16 | ≈11 tok/s | 试算 → |
| Qwen3.8 27B | 20.7 GB | 宽裕 | FP16 | ≈11 tok/s | 试算 → |
| Muse Glimmer 30B | 20.1 GB | 宽裕 | FP16 | ≈10 tok/s | 试算 → |
| Qwen3 30B-A3B | 21.0 GB | 宽裕 | FP16 | ≈93 tok/s | 试算 → |
| Qwen3 32B | 23.7 GB | 宽裕 | FP16 | ≈9 tok/s | 试算 → |
| gpt-oss-20b | 14.7 GB | 宽裕 | FP16 | ≈85 tok/s | 试算 → |
| Llama 3.3 70B | 47.4 GB | 宽裕 | Q6_K | ≈11 tok/s | 试算 → |
| gpt-oss-120b | 73.6 GB | 需要多卡 | Q3_K_M | ≈241 tok/s | 试算 → |
| DeepSeek-R1 671B | 413.1 GB | 本地不可行 | — | — | 试算 → |
理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。
常见问题
- Mac Studio M3 Ultra 96GB 能跑什么模型?
- 可用约 72GB:gpt-oss-120b Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕、其余全部宽裕。Q4 口径下 gpt-oss-120b(73.6GB)差 1.6GB,需降档或双机。
- 为什么 M3 Ultra 涨价了?
- 2026 年 DRAM 短缺:Apple 于 2026-03 停售 256/512GB 版本,2026-06-25 将 96GB 版从 $3,999 调至 $5,299。96GB 成为当前 Apple 单机内存上限。
- M3 Ultra 96GB 和双 4090(48GB)怎么选?
- 要 60GB+ 容量装 120B 级 MoE:只能 M3 Ultra(双 4090 只有 48GB);只跑 70B 以下且要 CUDA 生态:双 4090 速度更快还便宜。容量断层决定选型。
相关指南
在显卡兼容性查询工具中试算 Mac Studio M3 Ultra (96GB) →
数据核实于 2026-09-01