GPUFits

显卡库 / Mac Studio M3 Ultra (96GB)

Mac Studio M3 Ultra (96GB) 跑本地 LLM:能跑什么模型、速度多快

Mac Studio M3 Ultra 96GB 是本地大模型的“准数据中心”:96GB 统一内存可用约 72GB、819 GB/s 带宽,gpt-oss-120b Q4(约 73.6GB)差一口气、Q3_K_M(约 60GB)勉强,70B 可上 Q6_K(约 62GB)宽裕。价格背景必须说清:发售价 $3,999,2026 年 6 月 25 日调价后 $5,299;且 2026 年 3 月起 Apple 因 DRAM 短缺停售 256/512GB 版本——96GB 就是当前能买到的上限,DeepSeek-R1 满血(413GB+)由此在 Apple 单机上彻底无望。

819 GB/s 跑 MoE 模型极快(gpt-oss-120b 理论约 200 tok/s),跑稠密 70B 理论约 14 tok/s——容量有余、带宽中庸是它的准确画像。买家:需要 60-72GB 可用显存、拒绝多卡运维的开发者/小团队。$5,299 的定价让它必须和双卡 4090/A6000 方案认真比价后再出手;若只是 70B Q4 目标,M4 Max 64GB 能省 $2,400。

规格

标称显存96 GB
可用显存(模型可用)72.0 GB
显存带宽819 GB/s
类型统一内存
发布年份2025
MSRP$5,299
TDP100 W

Apple 统一内存按 75% 折算为模型可用显存(其余供系统/显示)。

性价比指标

每美元带宽
0.15 GB/s/$
每美元可用显存
0.014 GB/$

按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈96 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈38 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈37 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈21 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 FP16 ≈13 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 FP16 ≈11 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 FP16 ≈11 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 FP16 ≈10 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 FP16 ≈93 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 FP16 ≈9 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 FP16 ≈85 tok/s 试算 →
Llama 3.3 70B 47.4 GB 宽裕 Q6_K ≈11 tok/s 试算 →
gpt-oss-120b 73.6 GB 需要多卡 Q3_K_M ≈241 tok/s 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

Mac Studio M3 Ultra 96GB 能跑什么模型?
可用约 72GB:gpt-oss-120b Q3_K_M(约 60GB)勉强、70B Q6_K(约 62GB)宽裕、其余全部宽裕。Q4 口径下 gpt-oss-120b(73.6GB)差 1.6GB,需降档或双机。
为什么 M3 Ultra 涨价了?
2026 年 DRAM 短缺:Apple 于 2026-03 停售 256/512GB 版本,2026-06-25 将 96GB 版从 $3,999 调至 $5,299。96GB 成为当前 Apple 单机内存上限。
M3 Ultra 96GB 和双 4090(48GB)怎么选?
要 60GB+ 容量装 120B 级 MoE:只能 M3 Ultra(双 4090 只有 48GB);只跑 70B 以下且要 CUDA 生态:双 4090 速度更快还便宜。容量断层决定选型。

相关指南

在显卡兼容性查询工具中试算 Mac Studio M3 Ultra (96GB) →

数据核实于 2026-09-01