一个押注「打包」的本地模型运行器

Ollama 是一个 Go 二进制,用一条命令在你自己的机器上下载、运行并托管开源大语言模型。它从第一个 commit 起就押一个判断:模型本身从来不是难点,难的是模型周围的一切:Python 环境、权重转换、量化选择、GPU 胶水代码。Ollama 把这些都吞掉,只把一个提示符交到你手里。

它为什么火起来

在本地跑模型,意味着你的 prompt 和数据不出本机、按 token 不花钱、还能离线工作。能这么宣称的项目不少。Ollama 的优势在「上手坡道」:按名字拉量化权重,替你的硬件挑好默认值,同时暴露一个 CLI 和一个跑在 localhost:11434 的本地 REST API,于是同一个模型既撑你的终端、也撑你的应用。从 2023 年中至今,它从单个 star 涨到 173,589(截至 2026-06),而且仍在迭代,最新的 v0.30.7 发布于 2026 年 6 月。上方曲线是采样的,所以请读它的形状而非精确日期:一条早期快速攀升、此后未见走平的曲线。

它今天能做什么

  • 一条命令 ollama,要么让你直接跑模型,要么把 Ollama 接进你已经在用的工具。
  • 一个按名字拉取的模型库,量化已替你处理好。
  • 一个本地 REST API,外加官方的 ollama-pythonollama-js 客户端。
  • 推理跑在 llama.cpp 后端上,所以模型覆盖范围跟着 llama.cpp 走。
  • MIT 许可,issue 区很忙(截至 2026-06 有 3,366 个未关 issue)。

安装

macOS 与 Linux:

curl -fsSL https://ollama.com/install.sh | sh

Windows(PowerShell):

irm https://ollama.com/install.ps1 | iex

官方 ollama/ollama 镜像在 Docker Hub 上,供无头与服务端使用;各平台的手动下载从 ollama.com/download 链出。

首次运行

ollama run gemma4

首次使用会拉取模型,然后把你丢进一个对话。要从代码里驱动它,调 REST API 或装个客户端:

pip install ollama

装好客户端后,一个最小的 Python 调用:

from ollama import chat

reply = chat(model="gemma4", messages=[{"role": "user", "content": "天为什么是蓝的?"}])
print(reply.message.content)

不用任何客户端,同样的请求走 REST API:

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4",
  "messages": [{"role": "user", "content": "天为什么是蓝的?"}],
  "stream": false
}'

可拉取的模型清单见 ollama.com/library,其余细节看 quickstart 指南。

悄悄转向「启动其它工具」

一个值得留意的近期变化:敲 ollama 不再只是列模型,它会主动提议把 Ollama 接到你已经在跑的工具上。ollama launch claude 把 Claude Code 指向你的本地端点,同样的模式覆盖 Codex、Copilot CLI、Droid 和 OpenCode。OpenClaw 走得更远,把本地模型变成一个能从 WhatsApp、Telegram、Slack、Discord 触达的助手。这个产品正从「一种跑模型的方式」漂移向「别的 agent 插上来用的本地后端」,在托管 API 日益同质化的当下,这是个更站得住的位置。

适合,与不适合

当你想在笔记本或单台机器上跑模型时选 Ollama:做原型、处理私有数据,或把一个本地后端接进编辑器或 agent。它不是为高吞吐、多卡服务设计的,那种场景下 vLLM 能从同样的硬件里榨出多得多的 token 每秒。它默认用量化权重,所以需要全精度的评测工作得你自己另行配置。

Ollama 与其它本地运行时对比

Ollamallama.cppvLLMSGLangLM Studio
Star 数173,589115,60482,23328,904闭源
Fork 数16,51219,34817,8066,424
未关 issue3,3661,7635,2693,811
语言GoC++PythonPython
许可MITMITApache-2.0Apache-2.0专有
最擅长本地开发与应用后端嵌进你自己的二进制高吞吐 GPU 服务高吞吐 GPU 服务点点点的图形化对话

数字为 GitHub 2026 年 6 月数据。llama.cpp 是 Ollama 构建其上的引擎,所以这组对比讲的是「你怎么驱动它」,不是裸速度。要在多卡主机上追求最高 token 每秒,vLLM 和 SGLang 是更重型的选择,两者都为规模化「服务」而生,到那个量级,单机便利已经不是重点。LM Studio 是闭源桌面应用,没有可衡量的公开仓库。

上手前,issue tracker 会告诉你的事

README 是一张下载页。真正的取舍藏在未关的 issue 里,而最高反应的那些,集中在几个诚实的限制上:

  • 硬件加速比「本地」二字暗示的要窄。 因为推理走 llama.cpp,主流 NVIDIA 以及较新的 AMD、Apple GPU 覆盖得不错,但呼声最高的未关 issue,是求支持 AMD 和 Intel 的 NPU、Intel Arc 显卡,以及 gfx803 这类较老的 AMD 卡。在这些硬件上你可能悄悄回退到 CPU,体验会完全不同。上手前先核对你的 GPU 在不在支持范围内。
  • 默认上下文窗口偏小,而且是静默截断。 「按模型管理上下文长度」是 issue 区反复出现的诉求。如果你贴了一段长 prompt、模型却像忘了开头,通常就是这个原因。你得在模型的 Modelfile 参数里调高它;没有一个全局开关能搞定。
  • 它会「反客为主」。 反应最高的 issue 之一,是求它别把模型和配置塞进你的家目录(系统盘小的机器上是真问题);另一个是求一个开关,关掉它装好的、开机自启的后台服务。两者都可配,但都不是默认。
  • 有些能力还停留在「请求」阶段。 Model Context Protocol(MCP)支持、reranking 模型、图像生成、以及 Prometheus 的 /metrics 端点,都排在未关 issue 的前列,还没做出来。
  • 拉模型在带宽上是「全有或全无」。 那些动辄数 GB 的下载没有内建限速,在计量计费或共享网络下会很难受。

这些都不致命。它们是「营销表面」与「真正用上它的头一周」之间的差距。

相关

如果你在 TensorFlow 这类框架里训练或微调,Ollama 是托管你最终选定的开源模型的一种方式。它也能和 AI 原生编辑器搭配,把助手指向本地 Ollama 端点而非托管 API,这一思路由如今已归档的 Void 推广开来。想看更大图景,见 LLM 工具趋势

常见问题

Ollama 免费吗? 是。它是 MIT 许可,在本地运行,没有按 token 的费用。

Ollama 会用我的 GPU 吗? 在主流 NVIDIA 以及较新的 AMD、Apple GPU 上会;在 NPU、Intel Arc 和一些较老的卡上可能回退到 CPU,这些正是呼声最高的未关 issue。

为什么模型像是忘了长 prompt 的开头? 默认上下文窗口有限,且是静默截断。请在该模型的 Modelfile 参数里调高它,别指望长 prompt 默认就装得下。

Ollama 把模型存在哪? 默认在你的家目录下,这在系统盘小的机器上是常见抱怨。存储位置可以重新配置。