第 2 步
第 2 步:看懂硬件:显存管装不装得下,带宽管跑多快
更新于 2026-09-11 · 核实于 2026-09-11
一个类比:书桌和手速
把显卡想象成你写作业的书桌。
显存(VRAM)是桌面的大小。 模型的全部”零件”(术语叫权重,就是模型学到的知识本身)必须完整摊在桌面上才能开工。桌面不够大,资料就得放回书架——书架设在你的内存里,每用一次都要起身去拿,有多慢后面会说。
显存带宽是你的手速。 模型生成文字的方式很笨:每写一个字,都要把摊在桌上的全部资料从头到尾翻一遍。资料越厚(模型越大),写得越慢;手翻得越快(带宽越高),写得越快。至于脑子多聪明——显卡的算力、核心数——在这种纯翻书的活里几乎派不上用场。
为什么显存是第一位
因为它是门槛:不过线,一切免谈。一个模型需要多少显存,算法很简单:
显存需求 ≈ 权重(参数量 × 每个参数占的字节) + 对话缓存 + 约 1.5GB 系统开销
以 Llama 3.1 8B 为例:80 亿参数,用 Q4 量化(“量化”就是把模型里的数字压缩着存,体积变小、质量损失很小)后权重约 4.9GB,加上对话缓存和开销,总共约 7.5GB——一张 12GB 的显卡就能轻松装下。但换成 70B 模型,光权重就要约 43GB,任何单张消费级显卡都装不下。
装不下不是”慢一点”,是”跑不了”或”慢到没法用”。所以选硬件的第一件事永远是:想跑的模型需要多少显存,我的卡有多少。
带宽决定跑多快
装得下之后,速度几乎只看带宽一个参数。估算公式(本站工具同款):
理论速度(tok/s)≈ 带宽(GB/s)× 0.75 ÷ 每生成一个 token 要读的权重(GB)
tok/s 是”每秒生成多少个 token”,粗略理解成每秒吐多少个字。代入 8B Q4(每个字要读约 4.9GB 权重):
- RTX 3060(360 GB/s):约 55 tok/s
- RTX 4090(1008 GB/s):约 154 tok/s
- Mac mini M4 Pro(273 GB/s):约 42 tok/s
都是理论估算,实际受软件框架、散热影响,误差 ±30%,但横向比较完全够用。注意一个反直觉的事实:快慢不由”卡多贵、核心多少”决定。48GB 的专业卡 RTX A6000 比 4090 贵得多,带宽却更低(768 GB/s),跑同一个模型反而更慢。
CPU 内存为什么不能替代显存
很多人的第一反应是:“我内存有 64GB,比显存大多了。“容量确实大,问题在手速:普通 DDR5 双通道内存的带宽约 60–100 GB/s,而 RTX 4090 是 1008 GB/s,差十倍不止。把 8B 模型从显存挪到内存里跑,速度会从约 154 tok/s 掉到约 12 tok/s(理论估算)——从打字机变成一个字一个字蹦,聊天体验直接报废。
唯一的例外是苹果芯片的 Mac:CPU 和显卡共用同一块内存池,不存在”搬回书架”这个动作,所以大内存 Mac 能直接跑大模型。但这个池子的带宽本身(120–819 GB/s)仍低于高端显卡——Mac 赢在容量,不是速度。
怎么查自己显卡的两个数
Windows 上按 Ctrl+Shift+Esc 打开任务管理器,切到”性能 → GPU”,右下角”专用 GPU 内存”就是你的显存容量。带宽在系统里查不到,也不用查——直接看显卡规格页,或者打开本站显卡库,每张卡的容量和带宽都列好了。
动手:找到你的卡
今天只要记住两件事:容量管”装不装得下”,带宽管”跑多快”。具体的数字不用背,打开下面的显卡库,找到你的卡,看这两列就够了。
想弄明白”为什么偏偏是带宽”的完整推导,深入阅读:显存带宽为什么决定 LLM 推理速度。
动手试试
找到你的卡,看它两行规格
不用背任何数字。打开显卡库,找到你的显卡(或想买的卡),只看两列:显存容量决定你能装多大的模型,显存带宽决定它跑多快。每张开卡页还直接列出了能跑哪些模型。
打开显卡库 →常见问题
显存差一点点不够,能借内存凑吗?
可以,这个功能叫'卸载'(offload),把放不下的部分放内存里。但速度会断崖式下跌——8B 模型从一百多 tok/s 掉到十几个。救急可以,长期用建议换小一点的模型或降一档量化。
显存越大,跑模型就越快吗?
不是。容量决定'装不装得下',带宽决定'跑多快',是两个独立的参数。24GB 的卡不会比 12GB 的卡快,只是能装更大的模型。买卡时两个数都要看,顺序是先容量后带宽。
显卡的 CUDA 核心数、算力重要吗?
对单人聊天的生成速度几乎不重要——那一段是纯带宽活。核心数只在'读提示词'(预填充)和多并发场景才体现差距,所以别拿核心数当选购依据。