GPUFits

显卡库 / Mac mini M4 Pro (48GB)

Mac mini M4 Pro (48GB) 跑本地 LLM:能跑什么模型、速度多快

Mac mini M4 Pro 48GB 是“安静跑进 30B 档”的最便宜门票:统一内存 48GB(按 75% 即 36GB 可供模型)、273 GB/s 带宽、整机约 50W、几乎无声,约 $1,799(M4 Pro $1,399 + 24→48GB 升级 $400【估】)。它能宽裕跑 Qwen3 30B-A3B Q4(约 21GB,理论约 100 tok/s——MoE 是 Mac 的绝配),32B 稠密 Q4(约 23.7GB)也在舒适区;70B(约 47.4GB)则超出容量。

局限是带宽:273 GB/s 跑稠密 8B 理论约 42 tok/s,能用但不快;统一内存买定离手无法升级,48GB 这一档务必一步到位。画像:桌面空间/噪音敏感、目标 30B 以内、接受 macOS 生态(MLX 与 llama.cpp Metal 后端都成熟)的用户。它常常是把人拉进本地 LLM 的第一台机器,后悔率很低。

规格

标称显存48 GB
可用显存(模型可用)36.0 GB
显存带宽273 GB/s
类型统一内存
发布年份2024
MSRP$1,799
TDP50 W

Apple 统一内存按 75% 折算为模型可用显存(其余供系统/显示)。

性价比指标

每美元带宽
0.15 GB/s/$
每美元可用显存
0.020 GB/$

按 MSRP(暂无二手价) 计算;二手价为市场参考价【估】,波动见评述。

模型判定矩阵(Q4_K_M @8K)

模型 显存需求 判定 推荐量化 理论速度
Llama 3.2 3B 4.4 GB 宽裕 FP16 ≈32 tok/s 试算 →
Llama 3.1 8B 7.5 GB 宽裕 FP16 ≈13 tok/s 试算 →
Qwen3 8B 7.7 GB 宽裕 FP16 ≈12 tok/s 试算 →
Phi-4 14B 12.2 GB 宽裕 FP16 ≈7 tok/s 试算 →
Mistral Small 3.2 24B 17.5 GB 宽裕 Q8_0 ≈8 tok/s 试算 →
Gemma 3 27B 22.4 GB 宽裕 Q8_0 ≈7 tok/s 试算 →
Qwen3.8 27B 20.7 GB 宽裕 Q8_0 ≈7 tok/s 试算 →
Muse Glimmer 30B 20.1 GB 宽裕 Q8_0 ≈7 tok/s 试算 →
Qwen3 30B-A3B 21.0 GB 宽裕 Q8_0 ≈58 tok/s 试算 →
Qwen3 32B 23.7 GB 宽裕 Q6_K ≈8 tok/s 试算 →
gpt-oss-20b 14.7 GB 宽裕 Q8_0 ≈53 tok/s 试算 →
Llama 3.3 70B 47.4 GB 本地不可行 Q2_K ≈7 tok/s 试算 →
gpt-oss-120b 73.6 GB 本地不可行 需 3 张 试算 →
DeepSeek-R1 671B 413.1 GB 本地不可行 试算 →

理论速度 = 带宽 × 0.75 ÷ 每 token 权重字节(MoE 按激活参数),实际受框架/驱动/CPU 影响,误差 ±30%。

常见问题

Mac mini M4 Pro 48GB 能跑什么模型?
可用显存按 75% 折算约 36GB:Q4 口径下 32B 档(Qwen3 32B 约 23.7GB)宽裕,Qwen3 30B-A3B 理论约 100 tok/s 体验极佳;70B 超出容量。
M4 Pro 跑 LLM 快吗?
看模型类型:MoE(激活 3-5B)理论 60-100 tok/s,流畅;稠密 8B 约 42 tok/s,能用;稠密 32B 约 10 tok/s,可读但偏慢。带宽 273 GB/s 是硬顶。
48GB 还是 64GB(M4 Max)?
目标 30B 以内:48GB 的 Mac mini 性价比更高;想碰 70B Q4(约 47.4GB)必须 64GB 以上的 Mac Studio——48GB 可用 36GB,差一代。

相关指南

在显卡兼容性查询工具中试算 Mac mini M4 Pro (48GB) →

数据核实于 2026-09-01