混合:云 + 本地
两个世界中最好的部分。一个按月订阅的前沿模型(Claude、GPT、Grok 或 Gemini)负责规划、推理、复核,把重复的粗活交给本地模型。私密、省钱,而且效率惊人。
本文核对于 3 个月前,部分命令可能已有变化。 如有出入,请告诉我们。
要点速览
混合方案把困难的推理、架构和审阅交给一个按月订阅的前沿模型(Claude 配 Claude Code、GPT 配 Codex、Grok 配 Grok Build、Gemini 配 Antigravity CLI),把重复、敏感或离线的工作交给由 Ollama 提供服务的本地模型。Claude Code 负责编排:它编写调用 11434 端口本地 API 的脚本。自 Ollama 0.15 起,Claude Code 本身也能用 ollama launch claude 跑在本地模型上,适合不能外流的代码或断网的时候。黄金法则:只把边界清晰的任务交给本地,并让人复核结果。
请先完成: Ollama 与本地模型
现在您手里有两个世界。一边是各大厂商的前沿模型,以订阅方式连同它们的代码 agent 一起使用:Claude 配 Claude Code,GPT 配 Codex,Grok 配 Grok Build,Gemini 配 Antigravity CLI。另一边是在您家免费运行的模型(Ollama)。错误的问题是「选哪个?」。真正的答案是:两个,同时,各就各位。
这就是混合搭配,也是用迷你主机工作最高效的方式。机器负责编排:它运行各个 agent,保管您的项目和脚本。前沿订阅每月固定价格(Claude Pro 或 ChatGPT Plus 20 美元,SuperGrok 30 美元,Google AI Pro 21.99 欧元,价格查于 2026 年 10 月 1 日),承担大部分推理。本地模型负责机密、重复和离线的工作。各档套餐、额度以及每家厂商允许什么,请看 订阅前沿模型。
本页的例子让 Claude Code 担任总指挥,因为这是最成熟的搭法;换成 Codex 或 OpenCode 也完全一样。云端 agent 决定谁做什么,并把大批量的工作委派给本地模型。
- Claude· Claude Code
- ChatGPT· Codex
- Grok· Grok Build
- Gemini· Antigravity CLI
- gemma4:26b
- qwen3.8:27b
- nomic-embed-text
为什么混着用,而不是二选一
两个世界有着相反的长处,而这恰恰使它们互补:
- **云端(Claude、GPT、Grok、Gemini)**在难的推理、长任务、可靠的 tool use、架构上无可匹敌。但订阅有额度上限(按 5 小时窗口和按周计算),API 按 token 计费,而且您的数据流向第三方。
- 本地(Ollama)按使用免费、私密、离线可用,对边界清晰且重复的任务来说足够好。但它在长链智能体和尖端推理上力不从心(我们在 选择您的模型 里直言不讳地讲过,Quelle IA 本地模型排名(法语网站)则把差距量化了出来)。
混合搭配取两者之长:您把尖端智能留在它真正要紧的地方,把成本和数据外泄压在其余的一切上,也就是 80% 的量。
Claude Code 当编排器:它怎么运作
让这成为可能的关键:Claude Code 能运行命令。而 Ollama 在 http://localhost:11434 上暴露了一个极简单的本地 API。所以 Claude Code 可以调用您的本地模型,通过一个 curl、一个脚本或一个小工具,就像它调用任何命令那样。
具体来说,您告诉 Claude:「这个批量任务别自己做,通过 Ollama API 委派给本地模型」。它写出在您的文件上循环的脚本,对每个文件敲本地模型,再把整合好的结果带给您。它保留全局视野;本地干苦活。
# Claude Code 编排的基本动作:调用本地模型(这里用速度快的 gemma4:26b)
curl -s http://localhost:11434/api/generate -d '{
"model": "gemma4:26b",
"prompt": "Résume ce fichier en 3 puces : '"$(cat rapport.md)"'",
"stream": false
}' | jq -r .response
给工作分流的四种具体办法
已完成 0 步,共 4 步 勾选记录只保存在此浏览器中。
-
按成本分流:批量给本地,尖端给云
您要重写 300 条产品描述、给 2000 条评论分类、或者批量生成样板代码?这是重复且有边界的:本地模型。您要设计模块的架构、或调试一个刁钻的竞态条件?这是稀少且困难的:Claude。Claude 写好流水线,本地免费跑完那 300 次调用。
-
按机密性分流:敏感的留在家里
专有代码、客户数据、不能外流的东西?您让本地模型来处理它们,什么都不离开机器。Claude 在非敏感的部分保留一个协调的角色。如果敏感的工作需要一个真正的代理,就用
ollama launch claude另开一个会话:还是 Claude Code,但发给模型的请求留在您家里。在专业场景下这是个有力的论据(参见 保护访问安全)。 -
自建 RAG:本地 embeddings,云端推理
您想让代理懂您的语料(您的文档、您的文章、您的代码)?用 Ollama 在本地生成 embeddings(
nomic-embed-text或同类),存起来,再让 Claude 在您喂给它的最相关段落上推理。建立关联和索引,在本地免费且私密;最终的智能,在 Claude 这一侧。 -
离线安全网:OpenCode + 本地接棒
没网了?火车、飞机、断线?您切到接着本地模型的 OpenCode,或者用
ollama launch claude切到 Claude Code 本身,继续写代码。云不再是单点故障:您的机器始终是一个自给自足的工坊。
把两者接起来,实操
Claude Code 是默认的编排器。您不用装什么特别的东西:它本来就会运行命令,所以它本来就会调用 Ollama。只要在您的 CLAUDE.md 里给它一条指令:
# 混合策略
- 对于重复且批量的任务(重写、分类、
摘要、生成样板代码),通过 Ollama API
(http://localhost:11434)委派给本地模型,别自己做。
- 复杂推理、架构和评审留给您自己。
- 标注为「敏感」的代码和数据:仅用本地模型。
从此,当您交给它一个大批量,它会写出敲本地的脚本,再把结果带给您。您掌舵,它分配。
第二种方案,自 Ollama 0.15 起: 整个 Claude Code 跑在本地模型上。Ollama 支持 Anthropic 的 API,一条命令就能接好:
# 一个大脑在本地的 Claude Code 会话
ollama launch claude --model qwen3.8:27b
开两个终端:平常的会话跑 Anthropic 的模型,负责架构和审阅;这个本地会话处理敏感或离线的代码。请准备至少 64,000 个 token 的上下文,以及一个会调用工具的模型(细节见 Ollama 与本地模型)。发给模型的请求不会离开机器;Claude Code 仍会发送运行遥测,据其文档不包含代码和提示词,设置 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 即可关闭。
OpenCode 让分流变得显式:您按任务切换模型。同时接上一个云端提供方(Anthropic/OpenRouter)和本地的 Ollama,然后通过 /models 切换:
- 难任务、推理、架构 → 云端模型;
- 批量、敏感或离线的任务 → 您的本地模型。
如果您想看见并掌控哪个模型处理什么,而不是让一个编排器替您决定,这就是理想的做法。想知道还有哪些编码工具接受本地模型(以及哪些拒绝),Quelle IA 维护着一份 最新清单(法语网站)。而且就算 Claude Code 仍是您的总指挥,OpenCode + 本地也是 Claude 能在命令行里调用的一条出色的「手臂」。
本文全部命令
常见问题
订阅一个前沿模型要花多少钱?
截至 2026 年 10 月 1 日,Claude Pro 或 ChatGPT Plus 每月 20 美元,SuperGrok 30 美元,Google AI Pro 21.99 欧元。价格固定,但套餐有用量上限,按每 5 小时一段和按周计算。这也是把大批量工作交给本地模型的又一个理由,本地模型用起来不花钱。
怎样让 Claude Code 把任务交给本地模型?
在项目的 CLAUDE.md 文件里写一次规则即可:重复性、大批量的任务通过 http://localhost:11434 上的 Ollama API 交给本地模型;复杂推理、架构和审阅留给 Claude;标记为敏感的数据只交给本地模型。之后您交给它一大批任务时,它会自己编写调用本地模型的脚本,再把结果汇总给您。
怎样用本地模型搭建 RAG?
用 Ollama 在本地为您的资料生成嵌入向量,比如用 nomic-embed-text,并把它们存起来。然后把最相关的段落提供给 Claude,由它在这些段落上推理。索引工作在您的机器上免费且私密地完成,只有最后的思考环节经过云端。
Claude Code 跑在本地模型上时,还会往外发数据吗?
发给模型的请求都留在您的机器上。根据其文档,Claude Code 仍会发送运行遥测,其中不含代码和提示词。设置变量 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 即可关闭。
能自己决定每个任务由哪个模型处理吗?
可以,用 OpenCode:同时接入一个云端服务商和本地的 Ollama,然后用 /models 来回切换。难的任务交给云端,大批量、敏感或离线的工作交给本地模型。如果您想亲眼看到并掌控谁在处理什么,而不想交给编排者去决定,这就是合适的做法。
本文涉及的术语: 前沿模型CodexGrok BuildAntigravity CLI编排者推理Claude CodeOpenCodeAPIOllama智能体量化
发现错误?
命令失效了,价格变了?
这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。