GPUFits

第 3 步

第 3 步:选模型和量化档:B、GGUF、Q4_K_M 都是什么意思?

更新于 2026-09-11 · 核实于 2026-09-11

上一步我们搞懂了显存是「模型的停车位」。这一步解决下一个问题:停车场里那么多模型,该挑哪一辆?打开下载页面,你会看到 Llama-3.1-8B-Instruct-Q4_K_M.gguf 这种文件名——别怕,把它拆成三段,每段都只有一句话。

8B 的 “B”:模型的脑容量

B 是 Billion(十亿),代表模型有多少亿个参数。 参数是模型内部的数字,数量越多,模型「记住和学会的东西」通常越多——可以粗略类比成脑容量:3B 约 30 亿个,8B 约 80 亿个,70B 约 700 亿个。

对新手只需要记住三档感觉:

  • 3B 左右:入门体验款,几乎任何电脑都能跑,日常聊天够用;
  • 8B 左右:甜点级,质量和体积的平衡点,大多数人的第一个正经模型;
  • 70B 以上:发烧级,聪明得多,但显存门槛也陡得多,先围观就好。

注意直觉陷阱:不是越大越好,是越大越吃显存。一个装不下的 70B 对你来说等于零。

GGUF:打包好的模型文件

GGUF 是本地大模型的通用文件格式,地位类似视频里的 MP4——一个文件(或几个分卷)就装下了整个模型,交给 Ollama、llama.cpp 这类运行时就能跑。它是 llama.cpp 项目的格式,现在成了本地部署的事实标准。你不需要懂它的内部结构,只要认得出:下载模型时,找文件名以 .gguf 结尾的。

Q4_K_M、Q8_0:模型的「压缩画质」

原始模型的每个参数用 16 bit 存储,很占地方。量化(quantization)就是把每个参数用更少的 bit 重新表示,像把无损照片压成 JPG:体积大降,画质略降。文件名里的 Q4_K_MQ8_0 就是不同的压缩档位:

档位8B 模型的文件体积白话评价
Q8_0约 8.5 GB几乎无损,和原版基本分不出
Q6_K约 6.6 GB显存有富余就选它
Q4_K_M约 4.9 GB社区默认档,新手直接选它
Q2_K约 3.2 GB只能出字,别用于正经事

关键结论:拿不准就选 Q4_K_M。 体积只有原版的约 30%,日常对话盲测基本分不出和 Q8 的差别;显存宽裕再升 Q6_K 或 Q8_0。而 Q4 再往下是悬崖——Q2 的模型会一本正经地胡说八道。

还有一个新手最常踩的坑:文件体积 ≠ 显存占用。模型跑起来后,还要加上「对话记忆」(KV 缓存,随聊天长度增长)和约 1.5GB 的运行时开销。比如 Llama-3.1-8B 的 Q4_K_M 文件 4.9GB,实际跑起来约 7.5GB(8K 上下文,理论估算)。粗略心算:Q4 档位下,显存需求(GB)≈ 0.6 × 参数 B 数,再加约 2.5GB。

想深入量化原理和各档位的完整实测对比,读我们的量化详解:Q4 与 Q8 到底差多少?;想搞懂每十亿参数到底占多少显存,看每十亿参数需要多少显存?

去哪里下载:Hugging Face

Hugging Face(huggingface.co)是全球最大的模型仓库,你可以把它理解成模型界的应用商店,绝大多数开源模型都在上面,免费注册、免费下载。找 GGUF 版本时认准两类来源:模型官方账号,或者 bartowski 这类专门制作高质量 GGUF 的社区账号——同一个模型会挂出一排文件,按上面教的,抓 Q4_K_M 那个就行。

总结一下:8B 定规模,GGUF 定格式,Q4_K_M 定档位,Hugging Face 定地点。现在你已经有能力看懂任何下载页面了——下一步,亲手算一笔账:

打开下面的显存计算器,挑一个你想跑的模型,看看它在你的显卡上是什么判定。

常见问题

模型越大就越聪明吗?

大方向上是,但前提是你跑得动。一个跑不起来、只能靠 CPU 卸载硬撑的 70B,体验远不如一张显卡上流畅运行的 8B。先按显存量力而行,再在能跑的里面选大的。

我能听出 Q4_K_M 和 Q8_0 的差别吗?

日常聊天、写作、翻译,绝大多数人分不出来。Q8 的优势集中在数学、长链条推理这类精细任务上。第一次玩,直接 Q4_K_M,不会错。

GGUF 文件下载下来能直接打开吗?

不能,它不是普通软件,需要运行时(如 Ollama、llama.cpp)来加载。别急,下一步我们就装 Ollama 并跑起来。