跳到正文
全部 31 篇FREN中文
目录
第 4 部分 · 第 8 篇,共 8 篇 难度:进阶 阅读时间:14 分钟

混合:云 + 本地

两个世界中最好的部分。一个按月订阅的前沿模型(Claude、GPT、Grok 或 Gemini)负责规划、推理、复核,把重复的粗活交给本地模型。私密、省钱,而且效率惊人。

本文目录
  1. 01为什么混着用,而不是二选一
  2. 02Claude Code 当编排器:它怎么运作
  3. 03给工作分流的四种具体办法
  4. 04把两者接起来,实操
  5. 05常见问题

要点速览

混合方案把困难的推理、架构和审阅交给一个按月订阅的前沿模型(Claude 配 Claude Code、GPT 配 Codex、Grok 配 Grok Build、Gemini 配 Antigravity CLI),把重复、敏感或离线的工作交给由 Ollama 提供服务的本地模型。Claude Code 负责编排:它编写调用 11434 端口本地 API 的脚本。自 Ollama 0.15 起,Claude Code 本身也能用 ollama launch claude 跑在本地模型上,适合不能外流的代码或断网的时候。黄金法则:只把边界清晰的任务交给本地,并让人复核结果。

请先完成: Ollama 与本地模型

现在您手里有两个世界。一边是各大厂商的前沿模型,以订阅方式连同它们的代码 agent 一起使用:Claude 配 Claude Code,GPT 配 Codex,Grok 配 Grok Build,Gemini 配 Antigravity CLI。另一边是在您家免费运行的模型(Ollama)。错误的问题是「选哪个?」。真正的答案是:两个,同时,各就各位。

这就是混合搭配,也是用迷你主机工作最高效的方式。机器负责编排:它运行各个 agent,保管您的项目和脚本。前沿订阅每月固定价格(Claude Pro 或 ChatGPT Plus 20 美元,SuperGrok 30 美元,Google AI Pro 21.99 欧元,价格查于 2026 年 10 月 1 日),承担大部分推理。本地模型负责机密、重复和离线的工作。各档套餐、额度以及每家厂商允许什么,请看 订阅前沿模型。

本页的例子让 Claude Code 担任总指挥,因为这是最成熟的搭法;换成 Codex 或 OpenCode 也完全一样。云端 agent 决定谁做什么,并把大批量的工作委派给本地模型。

总指挥 您的代码智能体 Claude Code、Codex 或 OpenCode · 决定谁做什么
云端 · 订阅制 前沿模型
  • Claude· Claude Code
  • ChatGPT· Codex
  • Grok· Grok Build
  • Gemini· Antigravity CLI
规划、架构、棘手的调试、复审、长任务
本地 · Ollama 本地模型
  • gemma4:26b
  • qwen3.8:27b
  • nomic-embed-text
重复性代码、批量重构、摘要、分类、嵌入:数据不出机器 ollama launch claude:整个智能体跑在本地模型上
结果 您的项目 能跑的代码
混合:Claude Code 把难的推理留在云端这一侧,把重复的粗活通过 Ollama 发给本地模型。一切都汇聚到您的项目。自 Ollama 0.15 起,Claude Code 也能直接接到本地模型上。

为什么混着用,而不是二选一

两个世界有着相反的长处,而这恰恰使它们互补:

  • **云端(Claude、GPT、Grok、Gemini)**在难的推理、长任务、可靠的 tool use、架构上无可匹敌。但订阅有额度上限(按 5 小时窗口和按周计算),API 按 token 计费,而且您的数据流向第三方。
  • 本地(Ollama)按使用免费、私密、离线可用,对边界清晰且重复的任务来说足够好。但它在长链智能体和尖端推理上力不从心(我们在 选择您的模型 里直言不讳地讲过,Quelle IA 本地模型排名(法语网站)则把差距量化了出来)。

混合搭配取两者之长:您把尖端智能留在它真正要紧的地方,把成本和数据外泄压在其余的一切上,也就是 80% 的量。

Claude Code 当编排器:它怎么运作

让这成为可能的关键:Claude Code 能运行命令。而 Ollama 在 http://localhost:11434 上暴露了一个极简单的本地 API。所以 Claude Code 可以调用您的本地模型,通过一个 curl、一个脚本或一个小工具,就像它调用任何命令那样。

具体来说,您告诉 Claude:「这个批量任务别自己做,通过 Ollama API 委派给本地模型」。它写出在您的文件上循环的脚本,对每个文件敲本地模型,再把整合好的结果带给您。它保留全局视野;本地干苦活。

# Claude Code 编排的基本动作:调用本地模型(这里用速度快的 gemma4:26b)
curl -s http://localhost:11434/api/generate -d '{
  "model": "gemma4:26b",
  "prompt": "Résume ce fichier en 3 puces : '"$(cat rapport.md)"'",
  "stream": false
}' | jq -r .response

给工作分流的四种具体办法

已完成 0 步,共 4 步 勾选记录只保存在此浏览器中。

  1. 按成本分流:批量给本地,尖端给云

    您要重写 300 条产品描述、给 2000 条评论分类、或者批量生成样板代码?这是重复且有边界的:本地模型。您要设计模块的架构、或调试一个刁钻的竞态条件?这是稀少且困难的:Claude。Claude 写好流水线,本地免费跑完那 300 次调用。

  2. 按机密性分流:敏感的留在家里

    专有代码、客户数据、不能外流的东西?您让本地模型来处理它们,什么都不离开机器。Claude 在非敏感的部分保留一个协调的角色。如果敏感的工作需要一个真正的代理,就用 ollama launch claude 另开一个会话:还是 Claude Code,但发给模型的请求留在您家里。在专业场景下这是个有力的论据(参见 保护访问安全)。

  3. 自建 RAG:本地 embeddings,云端推理

    您想让代理懂您的语料(您的文档、您的文章、您的代码)?用 Ollama 在本地生成 embeddings(nomic-embed-text 或同类),存起来,再让 Claude 在您喂给它的最相关段落上推理。建立关联和索引,在本地免费且私密;最终的智能,在 Claude 这一侧。

  4. 离线安全网:OpenCode + 本地接棒

    没网了?火车、飞机、断线?您切到接着本地模型的 OpenCode,或者用 ollama launch claude 切到 Claude Code 本身,继续写代码。云不再是单点故障:您的机器始终是一个自给自足的工坊。

把两者接起来,实操

Claude Code 是默认的编排器。您不用装什么特别的东西:它本来就会运行命令,所以它本来就会调用 Ollama。只要在您的 CLAUDE.md 里给它一条指令:

# 混合策略
- 对于重复且批量的任务(重写、分类、
  摘要、生成样板代码),通过 Ollama API
  (http://localhost:11434)委派给本地模型,别自己做。
- 复杂推理、架构和评审留给您自己。
- 标注为「敏感」的代码和数据:仅用本地模型。

从此,当您交给它一个大批量,它会写出敲本地的脚本,再把结果带给您。您掌舵,它分配。

第二种方案,自 Ollama 0.15 起: 整个 Claude Code 跑在本地模型上。Ollama 支持 Anthropic 的 API,一条命令就能接好:

# 一个大脑在本地的 Claude Code 会话
ollama launch claude --model qwen3.8:27b

开两个终端:平常的会话跑 Anthropic 的模型,负责架构和审阅;这个本地会话处理敏感或离线的代码。请准备至少 64,000 个 token 的上下文,以及一个会调用工具的模型(细节见 Ollama 与本地模型)。发给模型的请求不会离开机器;Claude Code 仍会发送运行遥测,据其文档不包含代码和提示词,设置 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 即可关闭。

常见问题

订阅一个前沿模型要花多少钱?

截至 2026 年 10 月 1 日,Claude Pro 或 ChatGPT Plus 每月 20 美元,SuperGrok 30 美元,Google AI Pro 21.99 欧元。价格固定,但套餐有用量上限,按每 5 小时一段和按周计算。这也是把大批量工作交给本地模型的又一个理由,本地模型用起来不花钱。

怎样让 Claude Code 把任务交给本地模型?

在项目的 CLAUDE.md 文件里写一次规则即可:重复性、大批量的任务通过 http://localhost:11434 上的 Ollama API 交给本地模型;复杂推理、架构和审阅留给 Claude;标记为敏感的数据只交给本地模型。之后您交给它一大批任务时,它会自己编写调用本地模型的脚本,再把结果汇总给您。

怎样用本地模型搭建 RAG?

用 Ollama 在本地为您的资料生成嵌入向量,比如用 nomic-embed-text,并把它们存起来。然后把最相关的段落提供给 Claude,由它在这些段落上推理。索引工作在您的机器上免费且私密地完成,只有最后的思考环节经过云端。

Claude Code 跑在本地模型上时,还会往外发数据吗?

发给模型的请求都留在您的机器上。根据其文档,Claude Code 仍会发送运行遥测,其中不含代码和提示词。设置变量 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 即可关闭。

能自己决定每个任务由哪个模型处理吗?

可以,用 OpenCode:同时接入一个云端服务商和本地的 Ollama,然后用 /models 来回切换。难的任务交给云端,大批量、敏感或离线的工作交给本地模型。如果您想亲眼看到并掌控谁在处理什么,而不想交给编排者去决定,这就是合适的做法。

本文涉及的术语: 前沿模型CodexGrok BuildAntigravity CLI编排者推理Claude CodeOpenCodeAPIOllama智能体量化

发现错误?

命令失效了,价格变了?

这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。

只保留页面、您的留言和选填的联系方式,别无其他。

第 26 / 31 篇 · 第 4 部分 还没有读过任何一篇 打开文章目录