GPUFits

新手学习路径

为零基础准备的 6 步学习路径:搞懂显存与量化、选对硬件、装运行时、跑起第一个本地模型,每步配一个动手小任务。

适合谁:完全没接触过本地部署的新手——不知道显存是什么、没听过量化、没装过任何运行环境,都能跟得上。

学完能做什么:理解显存与量化的基本概念,会用本站工具判断自己的硬件能跑什么模型,并亲手在自己的电脑上跑起第一个本地大模型。

  1. 1

    本地部署是什么?和云端调 API 的四个区别

    用白话讲清本地部署:模型下载到自己电脑上跑,数据不出本机、断网能用、多用多省。也说清什么时候其实该用 API——偶尔用和追最新模型两种场景。

    开始这一步 →

  2. 2

    看懂硬件:显存管装不装得下,带宽管跑多快

    零基础看懂显卡规格:显存是书桌大小,决定模型装不装得下;带宽是手速,决定生成快不快。附估算公式和具体数字,讲清为什么 CPU 内存替代不了显存。

    开始这一步 →

  3. 3

    选模型和量化档:B、GGUF、Q4_K_M 都是什么意思?

    零基础看懂模型命名:参数量 B 是什么、GGUF 文件是什么、Q4_K_M 和 Q8_0 怎么选,以及去 Hugging Face 哪个页面下载。

    开始这一步 →

  4. 4

    第一次跑起来:Ollama 十分钟路线

    零基础跟着做:下载安装 Ollama,一条命令跑起 Llama 3.2 3B,完成第一次对话,并学会用 ollama ps 查看资源占用。

    开始这一步 →

  5. 5

    跑不快或装不下怎么办:五步排查法

    模型装不下显卡、生成慢得像打字机?按固定顺序排查:降量化档、缩短上下文、开 q8 KV 缓存、CPU 部分卸载、多卡——每条附「什么时候用」的判断。

    开始这一步 →

  6. 6

    进阶地图:跑通之后,往哪走

    第一个模型跑通之后学什么:长上下文的显存代价、MoE 模型的特殊账本、Ollama/llama.cpp/vLLM 后端怎么选,以及什么时候该放弃本地去租云 GPU。

    开始这一步 →