跳到正文
全部 31 篇FREN中文
目录
第 4 部分 · 第 7 篇,共 8 篇 难度:简单 阅读时间:12 分钟 适用平台:Linux

Ollama 与本地模型

在您自己家跑真正的 AI 模型,免费且私密。安装、第一个模型,以及如何把它接到您的编码代理上。

本文目录
  1. 01安装 Ollama
  2. 02您的第一个模型
  3. 03把它接到您的编码代理上
  4. 04真正重要的三个设置
  5. 05要刻进脑子里的陷阱
  6. 06常见问题

要点速览

Ollama 让开放的 AI 模型在您自己的机器上运行:一条命令安装,一条命令启动模型,再加上一个监听 11434 端口、同时兼容 OpenAI 和 Anthropic 格式的本地 API。入门时,qwen3.5:9b 在 16 GB 的机器上就能跑,qwen3.8:27b 需要一块 24 GB 的显卡或 32 GB 的统一内存。OpenCode 原生支持它,自 Ollama 0.15 起 Claude Code 也可以,用 ollama launch claude 即可;Codex 则用 ollama launch codex 或 codex --oss。请自己设定上下文大小,因为默认值取决于内存,在大内存机器上会升到 256,000 个 token。

请先完成: 选择并调好您的模型

到目前为止,您的编码代理一直在跟云端的模型对话。现在我们要把真正的 AI 模型跑直接在您的 mini-PC 上。而让这件事毫无痛苦地成为可能的,就是 Ollama。

Ollama 是在本地运行 open-weight LLM 最简单的方式。一条命令装好,一条命令下载模型,然后您就有了一个监听 11434 端口的本地 API,说的是 OpenAI 的格式,自 Ollama 0.14(2026 年 1 月)起也说 Anthropic 的格式:市面上几乎所有工具都能接上它。三个无需多言的好处:它私密(什么都不离开机器),它免费,而且它能离线工作。

安装 Ollama

一行。脚本会安装二进制并把它作为系统服务启动,它在后台运行,随时待命。

curl -fsSL https://ollama.com/install.sh | sh

就这样。Ollama 现在监听在 http://localhost:11434。

您的第一个模型

我们从一个几乎到处都能跑的模型开始:qwen3.5:9b,90 亿参数,下载 6.6 GB。在 Quelle IA(法语网站,2026 年 9 月 28 日版)的排名中,它是 8 到 14 GB 可用内存里评分最高的模型,因此是 16 GB 机器的合适选择。

# 起点,适合 16 GB 的机器
ollama run qwen3.5:9b
# 有 24 GB 显卡,或 32 GB 及以上统一内存时
ollama run qwen3.8:27b

qwen3.8:27b(18 GB)在同一日期,是从 24 GB 显卡到 128 GB mini-PC 都能装下的评分最高的模型。这些推荐变化很快:要找适合您机器的,请用 Quelle IA 的 找到我的模型 或 本地模型排名(法语网站)。细节见 选择您的本地模型。

首次启动会下载模型(几个 GB,耐心点)。之后您就直接进到终端里的一个聊天界面:问它个问题、让它写段代码、确认它能回应。输入 /bye 退出。

已完成 0 步,共 3 步 勾选记录只保存在此浏览器中。

  1. 看看您有什么

    ollama list   # 所有已下载的模型,以及它们的大小
    
  2. 看看什么在跑

    ollama ps     # 此刻、现在加载在内存里的模型
    
  3. 做清理

    ollama rm qwen3.5:9b   # 删掉一个模型,腾出空间
    

把它接到您的编码代理上

三个代理都能接上 Ollama,各走各的路。它们提供的在线模型并不相同:Quelle IA 的编程工具页面(法语网站)列出了每个工具接受什么,包括个人密钥和本地模型。无论选哪个,请记住:在代码方面,本地模型仍然不及最好的在线模型。期待奇迹之前,先看看 Quelle IA 代码排名(法语网站)上的差距。

Claude Code 可以接到 Ollama 上。 自 0.14 版起,Ollama 支持 Anthropic 的 API;自 0.15 版起,一条命令就能完成全部连接:

ollama launch claude                       # 选一个模型,并在它上面启动 Claude Code
ollama launch claude --model qwen3.8:27b   # 或者直接指定想要的模型

不用 ollama launch 的话,三个变量就够了,在当前会话内有效:

export ANTHROPIC_AUTH_TOKEN=ollama        # 必填,但 Ollama 会忽略它
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.8:27b

请选一个会调用工具的模型,并把上下文调到至少 64,000 个 token:Ollama 的文档为 Claude Code 推荐这个值。也要接受水平上的差距:框架相同,大脑小一号。大工程、长链推理和顶级可靠性,仍然是跑在 Anthropic 模型上的 Claude Code 更强。

Ollama 的本地 API 也可以用于附带的任务,不必在 Claude Code 里换模型:embeddings、快速分类、摘要、那些敲 http://localhost:11434 的小脚本,不花一分钱,也不把您的数据送往别处。云端管大脑,本地管水管活。

真正重要的三个设置

Ollama 装好就能用,但当您想压榨它时,三个环境变量带来天壤之别。您把它们放进服务的环境里(systemctl edit ollama 然后 Environment="...")。

要刻进脑子里的陷阱

十有八九,当有人说「Ollama 在我这儿很慢」,罪魁祸首是上下文设得太高。而在内存充裕的机器上,如今把它设得太高的,正是默认值。

原因如下。上下文窗口越大,KV 缓存(模型的工作内存)吃的 RAM 越多,而且涨得很快。如果您在一台勉强够用的机器上要一个巨大的上下文,您就会溢出到交换分区(swap)(拿磁盘当后备 RAM),到那时一切都崩了:模型卡顿,每个 token 都要等上一辈子,您以为您的硬件不行,其实是它被憋住了。

规则是:把上下文设成任务需要的量,而不是最大值。 一个小脚本?4096 就够。在真实代码库上跑编码代理?64,000,但要盯着您的 RAM:ollama ps 会显示实际加载的大小,并在 CONTEXT 一栏显示采用的上下文。正确的设置,是能把活干完的最小值。

常见问题

为什么 Ollama 在我的机器上这么慢?

十有八九是上下文窗口设得太大。窗口越大,KV 缓存(模型的工作内存)占用的 RAM 就越多;在内存紧张的机器上,一切都会溢出到 swap,每个 token 都慢得要命。请按任务的实际需要设定上下文,并用 ollama ps 查看实际加载的大小和最终采用的上下文。

怎样避免 Ollama 每次请求都重新加载模型?

默认情况下,Ollama 会在最后一次请求后让模型保持加载 5 分钟。设置 OLLAMA_KEEP_ALIVE=-1 后,模型会一直常驻内存;对于需要连续发出大量调用的智能体,这一点必不可少。这个变量写在服务的环境里,用 systemctl edit ollama 设置。

能从另一台设备使用 Ollama 吗?

可以,但要留在私有范围内:把监听地址 OLLAMA_HOST 保持为 localhost,或者通过 Tailscale 从其他设备访问。千万不要把 11434 端口暴露到公网,那等于把您的 GPU 白白送给随便哪个路人。

怎样查看和删除已下载的模型?

ollama list 命令列出所有已下载的模型及其大小,ollama ps 显示此刻已加载到内存中的模型。要腾出空间,用 ollama rm 加上模型名即可删除。

本地模型写代码能和 Claude 或 GPT 一样好吗?

不能,在写代码方面,本地模型仍然不及最好的在线模型:把 Claude Code 或 Codex 接到它上面,框架还是同一个,模型本身则弱一些。它有别的长处:私密、免费、离线可用。它也很适合做一些辅助任务,比如嵌入向量、快速分类或摘要。

本文涉及的术语: OllamaAPI参数RAM(内存)GPU(显卡)上下文窗口

发现错误?

命令失效了,价格变了?

这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。

只保留页面、您的留言和选填的联系方式,别无其他。

第 25 / 31 篇 · 第 4 部分 还没有读过任何一篇 打开文章目录