Ollama 与本地模型
在您自己家跑真正的 AI 模型,免费且私密。安装、第一个模型,以及如何把它接到您的编码代理上。
本文核对于 3 个月前,部分命令可能已有变化。 如有出入,请告诉我们。
要点速览
Ollama 让开放的 AI 模型在您自己的机器上运行:一条命令安装,一条命令启动模型,再加上一个监听 11434 端口、同时兼容 OpenAI 和 Anthropic 格式的本地 API。入门时,qwen3.5:9b 在 16 GB 的机器上就能跑,qwen3.8:27b 需要一块 24 GB 的显卡或 32 GB 的统一内存。OpenCode 原生支持它,自 Ollama 0.15 起 Claude Code 也可以,用 ollama launch claude 即可;Codex 则用 ollama launch codex 或 codex --oss。请自己设定上下文大小,因为默认值取决于内存,在大内存机器上会升到 256,000 个 token。
请先完成: 选择并调好您的模型
到目前为止,您的编码代理一直在跟云端的模型对话。现在我们要把真正的 AI 模型跑直接在您的 mini-PC 上。而让这件事毫无痛苦地成为可能的,就是 Ollama。
Ollama 是在本地运行 open-weight LLM 最简单的方式。一条命令装好,一条命令下载模型,然后您就有了一个监听 11434 端口的本地 API,说的是 OpenAI 的格式,自 Ollama 0.14(2026 年 1 月)起也说 Anthropic 的格式:市面上几乎所有工具都能接上它。三个无需多言的好处:它私密(什么都不离开机器),它免费,而且它能离线工作。
安装 Ollama
一行。脚本会安装二进制并把它作为系统服务启动,它在后台运行,随时待命。
curl -fsSL https://ollama.com/install.sh | sh
就这样。Ollama 现在监听在 http://localhost:11434。
您的第一个模型
我们从一个几乎到处都能跑的模型开始:qwen3.5:9b,90 亿参数,下载 6.6 GB。在 Quelle IA(法语网站,2026 年 9 月 28 日版)的排名中,它是 8 到 14 GB 可用内存里评分最高的模型,因此是 16 GB 机器的合适选择。
# 起点,适合 16 GB 的机器
ollama run qwen3.5:9b
# 有 24 GB 显卡,或 32 GB 及以上统一内存时
ollama run qwen3.8:27b
qwen3.8:27b(18 GB)在同一日期,是从 24 GB 显卡到 128 GB mini-PC 都能装下的评分最高的模型。这些推荐变化很快:要找适合您机器的,请用 Quelle IA 的 找到我的模型 或 本地模型排名(法语网站)。细节见 选择您的本地模型。
首次启动会下载模型(几个 GB,耐心点)。之后您就直接进到终端里的一个聊天界面:问它个问题、让它写段代码、确认它能回应。输入 /bye 退出。
已完成 0 步,共 3 步 勾选记录只保存在此浏览器中。
-
看看您有什么
ollama list # 所有已下载的模型,以及它们的大小 -
看看什么在跑
ollama ps # 此刻、现在加载在内存里的模型 -
做清理
ollama rm qwen3.5:9b # 删掉一个模型,腾出空间
把它接到您的编码代理上
三个代理都能接上 Ollama,各走各的路。它们提供的在线模型并不相同:Quelle IA 的编程工具页面(法语网站)列出了每个工具接受什么,包括个人密钥和本地模型。无论选哪个,请记住:在代码方面,本地模型仍然不及最好的在线模型。期待奇迹之前,先看看 Quelle IA 代码排名(法语网站)上的差距。
Claude Code 可以接到 Ollama 上。 自 0.14 版起,Ollama 支持 Anthropic 的 API;自 0.15 版起,一条命令就能完成全部连接:
ollama launch claude # 选一个模型,并在它上面启动 Claude Code
ollama launch claude --model qwen3.8:27b # 或者直接指定想要的模型
不用 ollama launch 的话,三个变量就够了,在当前会话内有效:
export ANTHROPIC_AUTH_TOKEN=ollama # 必填,但 Ollama 会忽略它
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.8:27b
请选一个会调用工具的模型,并把上下文调到至少 64,000 个 token:Ollama 的文档为 Claude Code 推荐这个值。也要接受水平上的差距:框架相同,大脑小一号。大工程、长链推理和顶级可靠性,仍然是跑在 Anthropic 模型上的 Claude Code 更强。
Ollama 的本地 API 也可以用于附带的任务,不必在 Claude Code 里换模型:embeddings、快速分类、摘要、那些敲 http://localhost:11434 的小脚本,不花一分钱,也不把您的数据送往别处。云端管大脑,本地管水管活。
这是通往 100% 本地编码代理的康庄大道。 OpenCode 原生就跟 Ollama 对话。自 Ollama 0.15 起,最短的路径是:
ollama launch opencode # 选好模型并启动 OpenCode,不改动您的配置
手动的话,您在 opencode.json 里把 Ollama 声明为一个提供方,指向本地 API:
http://localhost:11434/v1
然后用 /models 选择本地模型,例如 qwen3.8:27b。OpenCode 需要至少 64,000 个 token 的上下文(见下面的设置)。从此,您的代理思考、读您的代码、写文件,没有一个字节离开机器。免费、私密、离线。这正是 OpenCode 存在的场景。
Codex 原生认识 Ollama:它是 Codex 内置的「开源」提供方之一,用 --oss 开启。最短的路径是让 Ollama 自己来:
ollama launch codex # Ollama 准备一个专用的 Codex 配置并启动会话
手动的话,一个参数就够了:
codex --oss -m qwen3.8:27b # 在本地模型上开交互式会话
codex exec --oss -m qwen3.8:27b "总结一下 README" # 同样的事,非交互式
为了不必每次都选提供方,在 ~/.codex/config.toml 里写上 oss_provider = "ollama":没有这一行,交互式会话会让您在 Ollama 和 LM Studio 之间选择,而 codex exec --oss 会直接报错退出。这里 Ollama 的文档同样要求至少 64,000 个 token 的上下文。和 Claude Code 一样要有心理准备:框架相同,模型比 OpenAI 的小一号。
真正重要的三个设置
Ollama 装好就能用,但当您想压榨它时,三个环境变量带来天壤之别。您把它们放进服务的环境里(systemctl edit ollama 然后 Environment="...")。
要刻进脑子里的陷阱
十有八九,当有人说「Ollama 在我这儿很慢」,罪魁祸首是上下文设得太高。而在内存充裕的机器上,如今把它设得太高的,正是默认值。
原因如下。上下文窗口越大,KV 缓存(模型的工作内存)吃的 RAM 越多,而且涨得很快。如果您在一台勉强够用的机器上要一个巨大的上下文,您就会溢出到交换分区(swap)(拿磁盘当后备 RAM),到那时一切都崩了:模型卡顿,每个 token 都要等上一辈子,您以为您的硬件不行,其实是它被憋住了。
规则是:把上下文设成任务需要的量,而不是最大值。 一个小脚本?4096 就够。在真实代码库上跑编码代理?64,000,但要盯着您的 RAM:ollama ps 会显示实际加载的大小,并在 CONTEXT 一栏显示采用的上下文。正确的设置,是能把活干完的最小值。
本文全部命令
常见问题
为什么 Ollama 在我的机器上这么慢?
十有八九是上下文窗口设得太大。窗口越大,KV 缓存(模型的工作内存)占用的 RAM 就越多;在内存紧张的机器上,一切都会溢出到 swap,每个 token 都慢得要命。请按任务的实际需要设定上下文,并用 ollama ps 查看实际加载的大小和最终采用的上下文。
怎样避免 Ollama 每次请求都重新加载模型?
默认情况下,Ollama 会在最后一次请求后让模型保持加载 5 分钟。设置 OLLAMA_KEEP_ALIVE=-1 后,模型会一直常驻内存;对于需要连续发出大量调用的智能体,这一点必不可少。这个变量写在服务的环境里,用 systemctl edit ollama 设置。
能从另一台设备使用 Ollama 吗?
可以,但要留在私有范围内:把监听地址 OLLAMA_HOST 保持为 localhost,或者通过 Tailscale 从其他设备访问。千万不要把 11434 端口暴露到公网,那等于把您的 GPU 白白送给随便哪个路人。
怎样查看和删除已下载的模型?
ollama list 命令列出所有已下载的模型及其大小,ollama ps 显示此刻已加载到内存中的模型。要腾出空间,用 ollama rm 加上模型名即可删除。
本地模型写代码能和 Claude 或 GPT 一样好吗?
不能,在写代码方面,本地模型仍然不及最好的在线模型:把 Claude Code 或 Codex 接到它上面,框架还是同一个,模型本身则弱一些。它有别的长处:私密、免费、离线可用。它也很适合做一些辅助任务,比如嵌入向量、快速分类或摘要。
本文涉及的术语: OllamaAPI参数RAM(内存)GPU(显卡)上下文窗口
发现错误?
命令失效了,价格变了?
这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。