GPUFits

第 4 步

第 4 步:第一次跑起来:Ollama 十分钟路线

更新于 2026-09-11 · 核实于 2026-09-11

前面三步都是纸上谈兵,这一步来点真的:十分钟后,你的电脑上会有一个能对话的 AI,不联网、不花钱、不注册任何账号。 我们用的工具叫 Ollama——目前最简单的本地模型运行工具,安装它,剩下的它全包。

第 1 分钟:安装 Ollama

打开 ollama.com,点 Download:

  • Mac / Windows:下载安装包,双击,一路下一步,和装任何软件一样;
  • Linux:打开终端,粘贴一行命令:
curl -fsSL https://ollama.com/install.sh | sh

装完后打开终端(Mac 叫「终端」,Windows 叫 PowerShell 或「命令提示符」),输入:

ollama --version

能看到版本号,就成功了。

第 2–8 分钟:一条命令跑起来

在终端输入:

ollama run llama3.2

llama3.2 默认就是 3B 版本——上一步说过,这是「几乎任何电脑都能跑」的入门款。第一次运行会自动下载模型,约 2GB,几分钟的事(取决于网速)。下载完成后,你会看到 >>> 提示符——模型已经在跑了,直接打字聊天就行。

问它点什么,比如「用三句话解释什么是黑洞」。看着字一个一个蹦出来:这就是你的电脑在独立思考,一个字一个字往外写。

几个会话内小命令(以斜杠开头):

  • /bye —— 退出对话;
  • 想再聊,重新 ollama run llama3.2 即可,这次不用再下载。

第 9 分钟:看看它吃了多少资源

模型在跑的时候,另开一个终端窗口,输入:

ollama ps

你会看到类似这样的输出:

NAME           SIZE    PROCESSOR
llama3.2:...   4.0 GB  100% GPU

两列值得看懂:

  • SIZE:模型当前实际占用的内存+显存总量。文件只有 2GB,为什么显示约 4GB?回忆上一步:文件 ≈ 权重,跑起来还要加「对话记忆」和运行时开销(理论估算,8K 上下文合计约 4.4GB;Ollama 默认上下文更短,所以实测往往更小)。
  • PROCESSOR:100% GPU 表示模型整个跑在显卡上,这是最理想的状态;如果出现 50%/50% CPU/GPU 这类比例,说明显存不够、一部分挤进了内存——能跑,但会明显变慢。

有 NVIDIA 显卡的话,再开一个窗口输入 nvidia-smi,能看到显卡的显存占用和利用率;Mac 用户可以打开「活动监视器」看内存压力。

第 10 分钟:速度正不正常?

没有显卡也能跑——只是速度由内存带宽决定,3B 纯 CPU 大约每秒几十个字(理论估算 ±30%),聊天完全够用。有显卡的话会快得多,比如一张 RTX 3060 理论上能到每秒 100 字以上。如果慢到一秒一两个字,八成是模型没完全装进显存,回去看 ollama ps 的 PROCESSOR 列。

以后想完全掌控每个参数(上卡层数、上下文长度、自己下载的 GGUF 文件),可以进阶到底层引擎 llama.cpp——Ollama 其实就是跑在它之上的。两条路径的完整对比和参数细节,读GGUF 本地部署实操:llama.cpp 与 Ollama 两条路径

到这里,你已经完成了从零到一的跨越。别停在阅读上——现在就去动手:

常见问题

我的电脑没有独立显卡,能跑吗?

能。3B 这种小模型可以纯靠 CPU 和内存运行,只是速度会慢一些(理论估算约每秒几十个字),体验对话完全没问题。这也是我们选 3B 做第一次的原因。

下载的模型存在哪?占多少空间?

Ollama 会自动把模型存到它的数据目录里,Llama 3.2 3B 约 2GB。用 ollama list 可以看到已下载的所有模型,不想要的用 ollama rm 模型名 删除。

对话内容会传到网上吗?

不会。模型下载完成后,推理全程在你本机进行——你可以断网测试,它照样回答。这正是本地部署最大的意义之一。