中国大模型:MiMo、通义千问、DeepSeek、GLM、Kimi
离最强者只差一步的中国模型,价格却只是零头。编程套餐、按量付费的 API,或在迷你 PC 上本地运行:如何把它们接入 Claude Code、OpenCode 和 Codex,以及关于您的数据需要知道的事。
本文核对于 3 个月前,部分命令可能已有变化。 如有出入,请告诉我们。
要点速览
中国模型(小米的 MiMo、月之暗面的 Kimi、智谱 Z.ai 的 GLM、深度求索 DeepSeek、阿里巴巴的通义千问 Qwen、MiniMax)占据了 Quelle IA 开放权重模型排行榜的前十六行(2026 年 9 月 28 日版),比最好的美国模型低十分左右,价格却往往低得多:按每百万词元计,MiMo-V2.6-Pro 比 Claude Opus 5.5 便宜近十五倍。使用方式有三种:厂商的编程套餐(每月 6 至 199 美元)、按量付费的 API 或 OpenCode Go 这样的聚合平台,或者用 Ollama 在本地运行装得下的版本,例如 Qwen 3.8 27B。Claude Code 通过 ANTHROPIC_BASE_URL 接入,OpenCode 通过 /connect,Codex 通过 ~/.codex/config.toml 中的一个提供方。视具体服务而定,您的请求会经过中国、新加坡、欧洲或美国:不要发送密钥,也不要发送客户的代码。
请先完成: 订阅前沿模型:Claude、ChatGPT、Grok、Gemini
两年前,中国模型主要是一个在本地跑着玩的小号 Qwen。到了 2026 年 10 月,小米的 MiMo、月之暗面的 Kimi、智谱的 GLM 写代码几乎和 Anthropic、OpenAI 的头部模型一样好,价格却常常低得多。其中许多可以直接接入 Claude Code、OpenCode 或 Codex,还有专为此设计的包月套餐。
这篇指南带您走一遍:为什么值得关注、三种使用方式、每个工具的确切配置,以及那个让人头疼的问题:您的数据。
为什么值得关注
三个理由,有数据为证(排行榜来自 Quelle IA,法语网站,2026 年 9 月 28 日版)。
- 它们离最强者很近。 在综合排行榜上,排名最高的中国模型是小米的 MiMo-V2.6-Pro,在 246 个模型中排第 13,得分 90.5,其后是 Kimi K3(第 14)、Qwen 3.8 Max(第 21)、GLM-5.3(第 24)和 DeepSeek V4 Pro 0813(第 27)。榜首的 Claude Opus 5.5 得分 99.9。编程方面,GLM-5.3 以 91.5 分排第 9(编程排行榜)。
- 它们便宜得多。 MiMo-V2.6-Pro 每百万输入词元 0.44 欧元、每百万输出词元 0.87 欧元,而 Claude Opus 5.5 分别是 4 欧元和 20 欧元。在性价比排行榜上,前五名中有四个是中国模型:三个 DeepSeek 和 MiMo-V2.6-Pro。
- 它们的权重是开放的。 开放权重模型排行榜的前十六行全是中国模型。开放意味着可以下载:任何托管商都能提供服务,较小的版本还能在您家里运行。在可用内存介于 22 GB 与 189 GB 之间的机器上,装得下的最高分模型是阿里巴巴的 Qwen 3.8 27B(82.4)。
三种使用方式
1. 厂商的编程套餐
大多数中国厂商都出售专门用于编程的月度订阅,接入您的智能体即可使用。您支付固定金额,厂商按自己的方式计算用量,到达上限就会被切断(或降速)。
| 套餐 | 厂商与模型 | 每月价格 | 计量方式 | 厂商列出的工具 |
|---|---|---|---|---|
| Token Plan | 小米:MiMo-V2.6-Pro、MiMo-V2.6-Flash | 6、16、50 或 100 美元 | 每月积分(41 亿至 820 亿) | Claude Code、OpenCode、Codex、MiMo Code、Cline |
| GLM Coding Plan | 智谱 Z.ai:GLM-5.3、GLM-5.3-Flash | 18、80 或 168 美元 | 每 5 小时和每周的积分 | Claude Code、OpenCode、Codex、Cursor、Cline |
| Kimi Code | 月之暗面:K3、K2.7 Code | 19、39、99 或 199 美元 | 7 天积分加 5 小时窗口(约 300 至 1200 次请求) | Claude Code、OpenCode、Codex、Roo Code |
| M Plan | MiniMax:M3.1 Flash Preview | 22、55 或 132 美元 | 5 小时和 7 天窗口 | Claude Code、OpenCode、Codex、Cursor |
| Token Plan 个人版 | 阿里云:Qwen 3.8、Qwen 3.7、DeepSeek V4、GLM-5.3 | 8、16、25 或 80 美元(促销价 6、10、18 或 68 美元) | 每月积分 | Claude Code、Codex、Cursor、Qwen Code |
| Coding Plan Pro | 阿里云:Qwen 3.7 Plus、Kimi K2.5、GLM-5、MiniMax M2.5 | 50 美元(名额有限) | 每 5 小时 6000 次请求,每月 90000 次 | Claude Code、OpenCode、Codex、Cline |
以上为美元公开价,不含税,由 Quelle IA 于 2026 年 9 月 30 日从各套餐页面记录。不同厂商的积分无法互相比较:各有各的计算标准。包含年付折扣和确切模型的完整表格,见 Quelle IA 的工具页面(法语网站)。
2. 按量付费:厂商的 API 或聚合平台
每家厂商也按每百万词元出售 API,无需订阅:您充值余额,用多少付多少。这是脚本、机器人或应用的常规路线,在深度求索 DeepSeek 更是唯一的路线,因为它不卖编程套餐。每个模型的价格见 Quelle IA 的对比工具(法语网站)。
如果您想试用多个模型又不想开五个账号,可以走聚合平台(我们在安装 agent 中介绍过):
- OpenRouter:一把密钥通往数百个模型,包括本指南中的所有模型,按量付费。在 OpenCode 里非常合适。在 Claude Code 里,OpenRouter 提醒说只保证与 Anthropic 的模型正常配合。
- OpenCode Zen:OpenCode 团队的按量付费网关,模型都在智能体中测试过。它的页面写得很明白:「All our models are hosted in the US」。
- OpenCode Go:同一团队的套餐,每月 10 美元(Go Plus 为 40 美元),包含 GLM-5.3、Kimi K3、MiMo-V2.6-Pro、MiniMax M3、Qwen 3.8 和 DeepSeek V4.1 Flash 等。每个模型都有以美元用量计的月度上限(2026 年 9 月 30 日记录)。花一顿午饭的钱就能把它们都试一遍。
3. 在迷你 PC 上本地运行
这是本站偏爱的路线:开放模型用 Ollama 在您家里免费运行,什么都不发给别人。大型中国模型(Kimi K3、GLM-5.3、MiMo-V2.6-Pro)需要数百 GB 内存:迷你 PC 够不着。它们的小兄弟倒是装得很舒服。
# 16 GB 内存:Qwen3.5-9B,下载 6.6 GB
ollama pull qwen3.5:9b
# 32 GB 统一内存或 24 GB 显卡:Qwen 3.8 27B,18 GB
# 可用内存最高 189 GB 以内,这是装得下的最高分模型
ollama pull qwen3.8:27b
# 64 GB 及以上:Qwen3.5-35B-A3B,24 GB,每次只激活 30 亿参数,所以更快
ollama pull qwen3.5:35b-a3b
即使在 128 GB 的 Ryzen AI Max+ 395 上,装得下的最高分模型依然是 Qwen 3.8 27B(这台机器在 Quelle IA 上的页面,法语网站)。模型更大不一定更好:请借助选择并调好您的模型和 Quelle IA 的逐台机器推荐来挑选。
接入您的工具
这些厂商大多开了两扇门:一扇兼容 Anthropic 的 API,Claude Code 会用;一扇兼容 OpenAI 的 API,供 OpenCode 和 Codex 使用。您只需告诉工具该调用哪个地址、用哪把密钥。
已完成 0 步,共 4 步 勾选记录只保存在此浏览器中。
-
拿到密钥
在厂商的控制台创建密钥:套餐密钥(例如小米的以
tp-开头)或按量付费的 API 密钥。两者不能互换,各有各的地址。 -
选对地址
有些厂商每个地区一个地址。小米的 Token Plan 有三个:
token-plan-cn(中国)、token-plan-sgp(新加坡)和token-plan-ams(欧洲,阿姆斯特丹);控制台会给出您的那个。Kimi Code 区分api.kimi.com(中国)和api.kimi.ai(中国以外)。 -
配置工具
按下方您所用智能体的选项卡操作。
-
检查
在 Claude Code 里,
/status会显示正在使用的地址和模型。在 OpenCode 和 Codex 里,/models和/model会列出已接入的模型。跑一个小任务,再到厂商控制台看看用量。
Claude Code 读取三项设置:ANTHROPIC_BASE_URL(地址)、一把密钥,以及模型名称。不打乱您平常的 Claude Code 的诀窍:把这些设置放进一个单独的文件,只有在您用 --settings 指定时才加载。以 GLM Coding Plan 为例,依据智谱 Z.ai 的文档:
# 一个专供 GLM 使用的设置文件,与您的常规配置并存
cat > ~/.claude/glm.json <<'EOF'
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
"ANTHROPIC_AUTH_TOKEN": "您的_z_ai_密钥",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.3[1m]",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.3[1m]",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-5.3-flash[1m]",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
"API_TIMEOUT_MS": "3000000",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
EOF
chmod 600 ~/.claude/glm.json # 密钥在里面:只有您自己能读
# 一个跑在 GLM 上的 Claude Code 会话;直接输入 claude 仍然使用 Anthropic
claude --settings ~/.claude/glm.json
其他厂商只需按其文档更换地址、密钥变量和模型:
| 服务 | ANTHROPIC_BASE_URL | 密钥放在 | 模型 |
|---|---|---|---|
| 小米 Token Plan | https://token-plan-ams.xiaomimimo.com/anthropic(或 -sgp、-cn) | ANTHROPIC_AUTH_TOKEN | mimo-v2.6-pro |
| 小米按量付费 | https://api.xiaomimimo.com/anthropic | ANTHROPIC_AUTH_TOKEN | mimo-v2.6-pro |
| Kimi Code | https://api.kimi.ai/coding/ | ANTHROPIC_API_KEY | k3-256k |
| MiniMax M Plan | https://api.minimax.io/anthropic | ANTHROPIC_AUTH_TOKEN | MiniMax-M3.1-Flash-Preview |
| DeepSeek 按量付费 | https://api.deepseek.com/anthropic | ANTHROPIC_AUTH_TOKEN | deepseek-flash 或 deepseek-v4-pro |
如果您的 ~/.bashrc 里已经有 ANTHROPIC_BASE_URL 或 ANTHROPIC_AUTH_TOKEN,请删掉:小米和 MiniMax 都明确要求这样做,以免冲突。
OpenCode 已经认识其中大多数提供方:无需编写文件。启动 opencode,输入 /connect,搜索提供方,粘贴密钥,再用 /models 选择模型。
opencode
# 在 OpenCode 里:
/connect # 例如搜索「Z.AI Coding Plan」,然后粘贴密钥
/models # 选择 GLM-5.3
要搜索的名称,以 OpenCode 目录中的显示为准:Xiaomi Token Plan (Europe)、(Singapore) 或 (China),取决于您控制台给出的地址;按量付费的 API 选 Xiaomi;Z.AI Coding Plan 或 Z.AI;Kimi For Coding;M Plan 选 MiniMax Token Plan (minimax.io);DeepSeek;Alibaba Coding Plan;以及 OpenCode Go。密钥保存在 ~/.local/share/opencode/auth.json。
MiMo Code 是小米的智能体,由 OpenCode 衍生而来:界面相同、命令相同,默认就接好了小米。
curl -fsSL https://mimo.xiaomi.com/install | bash # 安装 mimo 命令
mimo auth login # 选择 MiMo,通过浏览器登录
cd ~/projects/my-project && mimo # 然后用 /models 切换模型
Codex 只说一种协议,即 OpenAI 的 Responses API:wire_api = "responses" 是唯一被接受的值。小米、智谱 Z.ai、Kimi 和 DeepSeek 都提供这一接口。先在 ~/.codex/config.toml 中声明提供方,再在一个配置档里选用它;配置档是一个小文件,在一次会话期间叠加在主配置之上。以 Kimi Code 为例,依据其文档:
# ~/.codex/config.toml:声明提供方,但不把它设为默认
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.kimi.ai/coding/v1" # 中国以外;中国境内用 api.kimi.com
env_key = "KIMI_API_KEY" # Codex 从这个环境变量读取密钥
wire_api = "responses"
# ~/.codex/kimi.config.toml:名为 kimi 的配置档
model_provider = "kimi"
model = "k3-256k"
model_catalog_json = "~/.codex/models.json" # Kimi 提供的模型说明文件
export KIMI_API_KEY="您的_kimi_密钥" # 写进 ~/.bashrc 以便长期保留
codex --profile kimi # 直接输入 codex 仍然使用 OpenAI
models.json 文件向 Codex 描述模型(上下文大小、推理档位):请从厂商文档中复制。其他兼容 Responses 的地址:智谱 Z.ai 为 https://api.z.ai/api/v1;小米为 https://api.xiaomimimo.com/v1(按量付费)或 https://token-plan-ams.xiaomimimo.com/v1(套餐,欧洲区);DeepSeek 为 https://api.deepseek.com/。
您的数据:去了哪里,被拿来做什么
开放模型和在线服务不是一回事。GLM 或 Qwen 的权重可以下载,在哪里都能运行。而当您使用厂商的 API 或套餐时,您的代码就送到了厂商那里,适用的是厂商的条款。以下是这些条款的内容,于 2026 年 10 月 1 日在官方页面上查阅:
| 服务 | 请求经过哪里 | 是否用您的内容训练 |
|---|---|---|
| 小米(API、Token Plan) | 视集群而定:中国、新加坡或欧洲;在中国大陆以外,协议规定数据存储在欧洲和新加坡 | 根据平台的隐私政策,未经您事先同意不会使用,但该政策针对的是在中国境内的使用;面向海外的版本未能找到 |
| 智谱 Z.ai(GLM) | 新加坡,「一般情况下」 | 对 API 客户,未经明确同意不会使用;对个人账号则可能使用。条款没有说明 GLM Coding Plan 属于哪一类 |
| 月之暗面(Kimi) | API 平台在新加坡;Kimi Code 方面,网上只有北京主体的政策(存储在中国) | API 条款允许使用,除非另有书面约定;而同一份文档的另一页对企业客户的说法恰恰相反 |
| MiniMax | 根据其隐私政策,位于美国的数据中心 | 输入和生成的内容可用于改进服务;未找到拒绝选项 |
| 阿里云(Token Plan) | 新加坡地域,「Global」推理:请求会跨境 | 根据产品条款,未经您同意不会使用 |
| 深度求索 DeepSeek | 中国,存储和处理都在中国 | 会使用,政策中规定了拒绝的权利 |
这些国际服务的合同都是与一家新加坡公司签订的(账单地址在欧洲时,阿里云通过其荷兰子公司签约),唯一的例外是深度求索 DeepSeek,它以杭州的公司签约,适用中国法律。
这些都不是中国独有的:使用任何在线服务商,包括美国的,您的代码都会离开机器,并受制于您无法掌控的条款。这里的分量在于:母公司是中国企业,条款有时页与页之间互相矛盾,而从欧洲对它们几乎没有约束力。正确的态度归结为一条规则:只把您毫无顾虑就能公开的东西发给这些服务。
本文全部命令
常见问题
中国模型和 Claude、GPT 的差距体现在哪里?
体现在长而难的任务上:大规模重构、棘手的 bug、需要设计的架构。对于日常代码,排行榜上十分左右的差距远不如账单上的差距明显。而且每个分数都有误差范围,Quelle IA 为每个模型都公布了误差。
中国厂商的编程订阅能用在脚本或应用里吗?
一般不行:这些订阅是用来在工具里写代码的。小米和阿里巴巴禁止在自动化脚本或应用服务器中使用订阅密钥,智谱 Z.ai 禁止从您的应用或机器人直接调用,MiniMax 则要求生产用途改用按量付费。如果是夜里在迷你 PC 上跑的机器人,请使用按量付费的 API。
在迷你 PC 上本地运行哪个中国模型?
Kimi K3、GLM-5.3、MiMo-V2.6-Pro 这类大模型需要数百 GB 内存,迷你 PC 无法承载。它们的小型版本用 Ollama 跑得很好:16 GB 内存用 Qwen3.5-9B,32 GB 统一内存或 24 GB 显卡用 Qwen 3.8 27B,64 GB 以上用 Qwen3.5-35B-A3B。即使在 128 GB 的机器上,Qwen 3.8 27B 仍是装得下的模型中评分最高的。
带 :cloud 标签的 Ollama 模型是在本地运行的吗?
不是。在 Ollama 模型库里,kimi-k3 和 minimax-m3 只有 :cloud 版本:ollama run kimi-k3:cloud 这条命令会把请求发到 Ollama Cloud 的服务器上,据 Ollama 称,这些服务器主要位于美国。用起来方便,但您的数据会离开这台机器。
DeepSeek 会用您的数据训练模型吗?
会。根据 2026 年 10 月 1 日查阅的政策,DeepSeek 会这样做,但提供了拒绝的权利。DeepSeek 在中国存储和处理请求,并以杭州的公司主体、依照中国法律签约。对于敏感代码,只有用 Ollama 在您自己机器上运行的开放模型,才能保证数据不外流。
本文涉及的术语: Claude CodeOpenCodeCodexToken(词元)RAM(内存)智能体API编程订阅统一 API推理
发现错误?
命令失效了,价格变了?
这些工具每个月都在变。请告诉我这篇文章哪里不对,我会改正并更新日期。