GPUFits

Mac 还是显卡?统一内存跑 LLM 全面解析

更新于 2026-09-10 · 核实于 2026-08-04

Apple Silicon 是本地 LLM 世界的异类:没有显存、没有 CUDA、听不到风扇声——却能装下需要四张 N 卡才能放下的模型。这篇文章不站队,用站内工具的同一套显存与速度公式,把两条路线算给你看,最后说清楚谁该买哪个。

统一内存改变了什么

PC 上,显卡有自己的显存(4090 是 24GB),CPU 有独立的内存。模型必须完整装进显存,否则就要承受 PCIe 来回拷贝层的惨重速度惩罚:一旦部分卸载到系统内存,等效带宽会被拖到 60–100 GB/s 量级,8B 模型从 4090 上的约 150 tok/s 直接掉到约 12 tok/s(详见 CPU offload 是否值得)。

Apple Silicon 在芯片封装上放了一个 CPU 与 GPU 共享的内存池。96GB 的 Mac Studio 能把 70GB 级的模型完整装下——没有任何消费级 N 卡能达到它的三分之一。「不用拷贝」确实是统一内存的结构性优势,但它解决的是容量问题,不是速度问题:这个共享池是 LPDDR5 而非 GDDR6X/GDDR7,带宽上限明显更低,而且焊死在封装上,买定离手,之后无法升级。

一句话总结两条路线的取舍:NVIDIA 用容量换速度,Apple 用速度换容量。

带宽天梯(均已核实)

芯片带宽最大内存8B Q4 大致速度
M4120 GB/s32GB约 15 tok/s
M4 Pro273 GB/s64GB约 40 tok/s
M4 Max(16 核)546 GB/s128GB约 80 tok/s
M3 Ultra819 GB/s96GB¹约 120 tok/s
RTX 4090(GDDR6X)1008 GB/s24GB约 150 tok/s
RTX 5090(GDDR7)1792 GB/s32GB约 265 tok/s

¹ 苹果 2026 年因 DRAM 缺货停产了 256GB/512GB 的 Mac Studio 配置;96GB 是当前上限,起售价从 3999 美元涨到 5299 美元。

速度列的算法与站内工具完全一致:理论 tok/s ≈ 带宽 × 0.75(效率系数)÷ 每 token 需读取的权重 GB。8B Q4_K_M 的权重是 8.03 × 4.9 ÷ 8 ≈ 4.9GB,代入 M4 Pro:273 × 0.75 ÷ 4.9 ≈ 42 tok/s。这是理论估算,实际受框架、驱动、散热影响,误差 ±30%——但作为横向比较的口径,它足够公平,也足够让你在做购买决策前排掉错误答案。

75% 规则

macOS 不会把一切都交给 GPU。系统与显示服务要保留内存,GPU 分配的实际天花板约为物理内存的 65–75%。我们的工具这样建模:

标称内存可用显存(×0.75)
32GB24GB
48GB36GB
64GB48GB
96GB72GB

社区做法是用 sysctl iogpu.wired_limit_mb 调高这个上限,能挤出更多容量,但有两个前提要知道:挤占的是系统自己的余量(开几个浏览器标签页就可能触发交换),而且带宽一 GB/s 都不会因此变多。买 Mac 时按上表右列选容量,别按左列的标称数字。

自己算一遍:四个具体例子

公式:总需求 = 权重(参数 × bpw ÷ 8)+ KV 缓存 + 1.5GB 运行时开销。以下全部按 Q4_K_M(bpw = 4.9)、8K 上下文、fp16 KV 计算,与站内 GPU 检查器 口径一致。

例 1:Llama 3.1 8B → 权重 4.9GB + KV 1.1GB + 开销 1.5GB ≈ 7.5GB。任何 12GB 显卡、任何 32GB 以上的 Mac 都绰绰有余。M4 Pro Mac mini 上约 40 tok/s,4090 上约 150 tok/s——都远超人类阅读速度,这个量级下两条路线的体验差距不大,选便宜的。

例 2:Qwen3-32B → 权重 20.1GB + KV 2.1GB + 开销 1.5GB ≈ 23.7GB。24GB 的 3090/4090 属于「刚好装下」(tight)——上下文拉到 32K 时 KV 涨到 8.4GB,就放不下了。48GB Mac mini(36GB 可用)装得很从容,但速度只有约 10 tok/s,而 4090 约 38 tok/s。同价位 N 卡快 3–4 倍,这就是 32B 以内该选 N 卡的原因。

例 3:Llama 3.3 70B → 权重 43.2GB + KV 2.6GB + 开销 1.5GB ≈ 47.4GB。单张 24GB 显卡直接出局(需要双卡);48GB Mac mini(36GB 可用)也装不下;64GB Mac Studio(48GB 可用)刚好 tight;96GB Studio(72GB 可用)才算从容。速度:M3 Ultra 约 14 tok/s,M4 Max 约 9–10 tok/s。

例 4:gpt-oss-120b(MoE) → 权重 71.5GB + KV 0.6GB + 开销 1.5GB ≈ 73.6GB——注意,这已经超过 96GB Studio 的 72GB 可用,Q4_K_M 档装不下,要降到 Q3_K_M(约 60.5GB)或用官方 MXFP4 版本。但 MoE 的生成速度按激活参数(5.1B)而非总参数算:M3 Ultra 上理论约 200 tok/s【估】。巨大容量 + 不慢的生成速度,这正是 Mac 的甜点位。

为什么 Mac 慢:预填充和解码是两回事

生成 token(解码)是带宽游戏:每吐一个字都要把(激活的)权重完整读一遍,上面的公式描述的就是它。但把 prompt 吃进去(预填充)是算力游戏——这恰是 Mac 的短板,Apple GPU 的矩阵算力远小于同价位 N 卡。

实际体验上:聊天时你感知的是解码速度,Mac 还过得去;但喂一篇长文档让它总结,或者 Agent 每轮都带着几万 token 的上下文重新预填充,等待会被明显放大。至于高吞吐、多并发的服务端场景,Mac 基本不在讨论范围内——那是 CUDA 与 vLLM 的地盘。

钱的问题:每美元带宽

机器价格带宽带宽/美元
二手 RTX 3090$1,100936 GB/s0.85
二手 RTX 4090$2,4001,008 GB/s0.42
Mac mini M4 Pro 48GB$1,799273 GB/s0.15
Mac Studio M4 Max 64GB$2,899546 GB/s0.19
Mac Studio M3 Ultra 96GB$5,299819 GB/s0.15

(价格取自站内数据 2026-08 快照,二手价为 eBay 成交口径【估】。)纯看生成速度,二手 N 卡的每美元带宽是 Mac 的 3–5 倍。Mac 的溢价买回的是另外三样东西:容量(72GB 可用 vs 单卡 24GB)、功耗与噪音(整机 50–100W vs 单卡 350–575W,长期电费差异可以用 成本对比器 算)、以及开箱即用(Ollama / LM Studio / MLX,不用碰驱动和 CUDA 版本地狱)。

谁该买什么

买 Mac 的理由: 想要一台静音、省电、能装巨大模型(70B 的 Q6_K、120B 级 MoE 的低量化档)的机器;看重「下载即跑」;主要场景是单人聊天与写作,能接受 70B 约 10–14 tok/s——聊天够用,跑 Agent 难受。

买 NVIDIA 的理由: 每美元速度更重要;要用 CUDA 工具链(vLLM、微调、Stable Diffusion);你的模型本来就在 24–32GB 以内;或者需要多并发。一张约 1,100 美元的二手 3090,在 32B 以内模型的性价比上让苹果全系汗颜——而且显存不够还能加卡,Mac 只能整机重买。

常见误区

  1. 「内存大 = 快」。 容量决定能不能跑,带宽决定跑多快。96GB Mac Studio 装得下 70B,但约 14 tok/s 的速度仍低于任何能装下它的 N 卡组合。
  2. 「96GB 的 Mac 能跑 Q8 的 70B」。 算一下就破功:Q8_0 权重就要 75.1GB,加 KV 与开销约 79GB,超过 72GB 可用。70B 在 96GB Mac 上的甜点是 Q6_K(约 62GB,8K 上下文)。
  3. 「装不下就 offload 到内存,反正能跑」。 能跑和能用是两回事:offload 把等效带宽拖进 60–100 GB/s 的断崖,8B 从约 150 tok/s 掉到约 12 tok/s,70B 会慢到失去耐心。
  4. 「统一内存没有瓶颈」。 省掉拷贝是真的,但 CPU 与 GPU 共享同一条带宽,系统和其他应用也在分这 273–819 GB/s——它是一条更宽的高速公路,不是无限宽的。

MLX 因素

苹果的 MLX 框架在同一台 Mac 上跑 LLM 推理通常比 llama.cpp 快 10–20%,且已成为多个 Mac 前端的默认后端。走 Mac 路线就优先选模型的 MLX 版本(Hugging Face 的 mlx-community 仓库基本覆盖主流模型)——注意 MLX 用自己的量化格式,不是 GGUF,站内量化表的 bpw 数字只能近似参考。

下单前的决策流程

  1. 先定模型和量化档,不要先看硬件。默认从 Q4_K_M 开始,显存富余再升档。
  2. 算显存:权重 + KV + 1.5GB 开销;对 Mac,记得可用内存要打 0.75 的折。不想手算就跑一遍 GPU 检查器
  3. 算速度:带宽 × 0.75 ÷ 每 token 权重。低于约 10 tok/s,聊天会觉得钝;要跑 Agent,就把预算往带宽上倾斜。
  4. 比价格:按上表算每美元带宽,再决定静音、省电、省心这几项值得你付多少「苹果税」。

常见问题

Mac mini 跑 LLM 表现如何?

M4 Pro 版 Mac mini(48GB,273 GB/s)是台不错的静音小主机,Q4 下能舒服地跑 32B 以内的模型:8B 约 40 tok/s,32B 约 10 tok/s。甜点其实是 MoE:Qwen3-30B-A3B 这类激活参数只有 3.3B 的模型,理论速度约 100 tok/s【估】。基础款 M4(120 GB/s)跑 7B–8B 可以,更大的模型就力不从心了。

为什么 Mac 不能把全部内存分给 GPU?

macOS 要为系统和显示服务保留内存,GPU 显存分配上限约为物理内存的 65–75%。我们的工具按 0.75 的可用系数建模:48GB 的 Mac 约有 36GB 可用显存,96GB 约 72GB。sysctl iogpu.wired_limit_mb 可以调高上限,但挤占的是系统余量,带宽也不会因此变多。

Mac Studio M3 Ultra 跑 LLM 比 RTX 4090 快吗?

速度上不行,容量上完胜。M3 Ultra 的 819 GB/s 低于 4090 的 1008 GB/s,70B Q4 在 M3 Ultra 上约 14 tok/s——而 4090 根本装不下这个模型(需约 47GB)。96GB Studio(72GB 可用)能装 70B 的 Q6_K(约 62GB)和 gpt-oss-120b 的 Q3_K_M(约 61GB),这些是任何单张 24GB 显卡都放不下的。

Mac 适合跑 Agent 或批量推理吗?

不太合适。解码速度由带宽决定,70B Q4 在 M3 Ultra 上约 14 tok/s,单人聊天够用;但 Agent 每轮都带着长上下文反复预填充,而预填充吃 GPU 算力恰是 Mac 的短板。高吞吐、多并发场景,NVIDIA + vLLM 的效率要高得多。

该买多大内存的 Mac?

按 0.75 可用系数反推:48GB(36GB 可用)覆盖 32B 以内的 Q4;64GB(48GB 可用)刚好勉强装下 70B Q4;96GB(72GB 可用)才能从容跑 70B Q6_K 和 120B 级 MoE 的低量化档。Apple Silicon 内存焊在封装上,买小了无法事后升级,宁大勿小。

来源