Les LLM chinois : MiMo, Qwen, DeepSeek, GLM, Kimi
Des modèles chinois tout près des meilleurs, pour une fraction du prix. Forfait de code, API à l'usage ou local sur le mini-PC : comment les brancher dans Claude Code, OpenCode et Codex, et ce qu'il faut savoir sur vos données.
Sur cette fiche
Fiche vérifiée il y a 3 mois : certaines commandes ont pu changer. Signalez-le si c’est le cas.
En bref
Les modèles chinois (MiMo de Xiaomi, Kimi de Moonshot, GLM de Z.ai, DeepSeek, Qwen d'Alibaba, MiniMax) occupent les seize premières lignes du classement des modèles ouverts de Quelle IA (édition du 28 septembre 2026), une dizaine de points sous les meilleurs modèles américains, pour un prix souvent bien plus bas : MiMo-V2.6-Pro revient près de quinze fois moins cher que Claude Opus 5.5 au million de jetons. On s'en sert de trois façons : un forfait de code de l'éditeur (de 6 à 199 $ par mois), l'API à l'usage ou un agrégateur comme OpenCode Go, ou en local avec Ollama pour les versions qui tiennent en mémoire, comme Qwen 3.8 27B. Claude Code s'y branche par ANTHROPIC_BASE_URL, OpenCode par /connect, Codex par un fournisseur dans ~/.codex/config.toml. Selon l'offre, vos requêtes passent par la Chine, Singapour, l'Europe ou les États-Unis : n'y envoyez ni secrets ni code client.
À faire avant : Les modèles frontières en abonnement : Claude, ChatGPT, Grok, Gemini
Il y a deux ans, un modèle chinois servait surtout à faire tourner un petit Qwen en local pour voir. En octobre 2026, MiMo de Xiaomi, Kimi de Moonshot ou GLM de Z.ai codent presque aussi bien que les modèles de tête d’Anthropic et d’OpenAI, et coûtent souvent beaucoup moins cher. Beaucoup se branchent directement dans Claude Code, OpenCode ou Codex, avec un forfait mensuel pensé pour ça.
Cette fiche fait le tour : pourquoi s’y intéresser, les trois façons de s’en servir, la configuration exacte de chaque outil, et la question qui fâche, celle de vos données.
Pourquoi s’y intéresser
Trois raisons, chiffres à l’appui (classements de Quelle IA, édition du 28 septembre 2026).
- Ils sont tout près des meilleurs. Au classement général, le premier modèle chinois, MiMo-V2.6-Pro de Xiaomi, est 13e sur 246 avec un score de 90,5, suivi de Kimi K3 (14e), Qwen 3.8 Max (21e), GLM-5.3 (24e) et DeepSeek V4 Pro 0813 (27e). En tête, Claude Opus 5.5 est à 99,9. En code, GLM-5.3 se classe 9e avec 91,5 (classement Code).
- Ils coûtent beaucoup moins cher. MiMo-V2.6-Pro revient à 0,44 € le million de jetons lus et 0,87 € le million écrits, contre 4 € et 20 € pour Claude Opus 5.5. Au classement qualité-prix, quatre des cinq premiers sont chinois : trois DeepSeek et MiMo-V2.6-Pro.
- Leurs poids sont ouverts. Les seize premières lignes du classement des modèles ouverts sont chinoises. Ouvert veut dire téléchargeable : n’importe quel hébergeur peut les servir, et les plus petits tournent chez vous. Sur une machine qui offre entre 22 et 189 Go de mémoire utile, le modèle le mieux noté qui tient est Qwen 3.8 27B d’Alibaba (82,4).
Trois façons de s’en servir
1. Le forfait de code de l’éditeur
La plupart des éditeurs chinois vendent un abonnement mensuel réservé au code, à brancher dans votre agent. Vous payez un montant fixe, l’éditeur compte votre consommation à sa façon, et vous êtes coupé (ou ralenti) au plafond.
| Forfait | Éditeur et modèles | Prix par mois | Ce qu’il compte | Outils cités par l’éditeur |
|---|---|---|---|---|
| Token Plan | Xiaomi : MiMo-V2.6-Pro, MiMo-V2.6-Flash | 6, 16, 50 ou 100 $ | crédits par mois (de 4,1 à 82 milliards) | Claude Code, OpenCode, Codex, MiMo Code, Cline |
| GLM Coding Plan | Z.ai : GLM-5.3, GLM-5.3-Flash | 18, 80 ou 168 $ | crédits par tranche de 5 heures et par semaine | Claude Code, OpenCode, Codex, Cursor, Cline |
| Kimi Code | Moonshot : K3, K2.7 Code | 19, 39, 99 ou 199 $ | crédits sur 7 jours et fenêtre de 5 heures (de 300 à 1 200 requêtes environ) | Claude Code, OpenCode, Codex, Roo Code |
| M Plan | MiniMax : M3.1 Flash Preview | 22, 55 ou 132 $ | fenêtres de 5 heures et de 7 jours | Claude Code, OpenCode, Codex, Cursor |
| Token Plan, édition personnelle | Alibaba Cloud : Qwen 3.8, Qwen 3.7, DeepSeek V4, GLM-5.3 | 8, 16, 25 ou 80 $ (6, 10, 18 ou 68 $ en promotion) | crédits par mois | Claude Code, Codex, Cursor, Qwen Code |
| Coding Plan Pro | Alibaba Cloud : Qwen 3.7 Plus, Kimi K2.5, GLM-5, MiniMax M2.5 | 50 $ (places limitées) | 6 000 requêtes par 5 heures, 90 000 par mois | Claude Code, OpenCode, Codex, Cline |
Prix publics hors taxes en dollars, relevés le 30 septembre 2026 par Quelle IA sur la page de chaque offre. Les crédits d’un éditeur ne se comparent pas à ceux d’un autre : chacun a son barème. Le tableau complet, avec les remises à l’année et les modèles exacts, est sur la page Outils de Quelle IA.
2. À l’usage : l’API de l’éditeur ou un agrégateur
Chaque éditeur vend aussi son API au million de jetons, sans abonnement : vous rechargez un crédit, vous payez ce que vous consommez. C’est la voie normale pour un script, un robot ou une application, et la seule chez DeepSeek, qui ne vend pas de forfait de code. Les prix de chaque modèle sont dans l’outil de comparaison de Quelle IA.
Si vous voulez goûter à plusieurs modèles sans ouvrir cinq comptes, passez par un agrégateur (on les présente dans Installer l’agent) :
- OpenRouter : une seule clé pour des centaines de modèles, dont tous ceux de cette fiche, payés à l’usage. Parfait dans OpenCode. Dans Claude Code, OpenRouter prévient que le fonctionnement n’est garanti qu’avec les modèles d’Anthropic.
- OpenCode Zen : la passerelle à l’usage de l’équipe OpenCode, avec des modèles testés dans un agent. Sa page l’écrit : « All our models are hosted in the US ».
- OpenCode Go : le forfait de la même équipe, 10 $ par mois (40 $ pour Go Plus), avec GLM-5.3, Kimi K3, MiMo-V2.6-Pro, MiniMax M3, Qwen 3.8 et DeepSeek V4.1 Flash, entre autres. Chaque modèle a son plafond mensuel en dollars d’usage (relevé le 30 septembre 2026). Un bon moyen de tous les essayer pour le prix d’un déjeuner.
3. En local sur le mini-PC
C’est la voie que ce site préfère : les modèles ouverts tournent chez vous avec Ollama, gratuitement, sans rien envoyer à personne. Les grands modèles chinois (Kimi K3, GLM-5.3, MiMo-V2.6-Pro) demandent plusieurs centaines de gigaoctets de mémoire : hors de portée d’un mini-PC. Leurs petits cousins, eux, tiennent très bien.
# 16 Go de mémoire : Qwen3.5-9B, 6,6 Go à télécharger
ollama pull qwen3.5:9b
# 32 Go de mémoire unifiée ou une carte graphique de 24 Go : Qwen 3.8 27B, 18 Go
# le mieux noté qui tienne, jusqu'à 189 Go de mémoire utile
ollama pull qwen3.8:27b
# 64 Go et plus : Qwen3.5-35B-A3B, 24 Go, plus rapide car il n'active que 3 milliards de paramètres à la fois
ollama pull qwen3.5:35b-a3b
Même sur un Ryzen AI Max+ 395 de 128 Go, Qwen 3.8 27B reste le mieux noté qui tient (la page de cette machine sur Quelle IA). Un modèle plus gros n’est pas forcément meilleur : choisissez avec Choisir et dimensionner son modèle et Quelle IA, machine par machine.
Les brancher dans vos outils
La plupart de ces éditeurs exposent deux portes : une compatible avec l’API d’Anthropic, que Claude Code sait utiliser, et une compatible avec celle d’OpenAI, pour OpenCode et Codex. Il suffit de dire à l’outil quelle adresse appeler et avec quelle clé.
0 étape sur 4 faite Vos cases cochées restent dans ce navigateur.
-
Prendre la clé
Créez votre clé dans la console de l’éditeur : clé de forfait (elle commence par
tp-chez Xiaomi, par exemple) ou clé d’API à l’usage. Les deux ne sont pas interchangeables, et chacune a son adresse. -
Choisir la bonne adresse
Plusieurs éditeurs ont une adresse par région. Le Token Plan de Xiaomi en a trois :
token-plan-cn(Chine),token-plan-sgp(Singapour) ettoken-plan-ams(Europe, Amsterdam) ; la console vous donne la vôtre. Kimi Code sépareapi.kimi.com(Chine) etapi.kimi.ai(hors de Chine). -
Configurer l'outil
Suivez l’onglet de votre agent ci-dessous.
-
Vérifier
Dans Claude Code,
/statusaffiche l’adresse et le modèle utilisés. Dans OpenCode et Codex,/modelset/modellistent ce qui est branché. Lancez une petite tâche et regardez la consommation dans la console de l’éditeur.
Claude Code lit trois réglages : ANTHROPIC_BASE_URL (l’adresse), une clé, et les noms de modèles. L’astuce pour ne pas casser votre Claude Code habituel : mettre ces réglages dans un fichier à part, chargé seulement quand vous le demandez avec --settings. Exemple avec le GLM Coding Plan, d’après la documentation de Z.ai :
# un fichier de réglages réservé à GLM, à côté de votre configuration normale
cat > ~/.claude/glm.json <<'EOF'
{
"env": {
"ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
"ANTHROPIC_AUTH_TOKEN": "votre_cle_z_ai",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.3[1m]",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.3[1m]",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-5.3-flash[1m]",
"CLAUDE_CODE_AUTO_COMPACT_WINDOW": "1000000",
"API_TIMEOUT_MS": "3000000",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
EOF
chmod 600 ~/.claude/glm.json # la clé est dedans : lisible par vous seul
# une session Claude Code sur GLM ; « claude » tout court reste sur Anthropic
claude --settings ~/.claude/glm.json
Pour les autres éditeurs, on change l’adresse, le nom de la variable de clé et les modèles, d’après leur documentation :
| Offre | ANTHROPIC_BASE_URL | Clé dans | Modèle |
|---|---|---|---|
| Xiaomi, Token Plan | https://token-plan-ams.xiaomimimo.com/anthropic (ou -sgp, -cn) | ANTHROPIC_AUTH_TOKEN | mimo-v2.6-pro |
| Xiaomi, à l’usage | https://api.xiaomimimo.com/anthropic | ANTHROPIC_AUTH_TOKEN | mimo-v2.6-pro |
| Kimi Code | https://api.kimi.ai/coding/ | ANTHROPIC_API_KEY | k3-256k |
| MiniMax, M Plan | https://api.minimax.io/anthropic | ANTHROPIC_AUTH_TOKEN | MiniMax-M3.1-Flash-Preview |
| DeepSeek, à l’usage | https://api.deepseek.com/anthropic | ANTHROPIC_AUTH_TOKEN | deepseek-flash ou deepseek-v4-pro |
Si ANTHROPIC_BASE_URL ou ANTHROPIC_AUTH_TOKEN traînent déjà dans votre ~/.bashrc, retirez-les : Xiaomi et MiniMax le demandent explicitement pour éviter les conflits.
OpenCode connaît déjà la plupart de ces fournisseurs : pas de fichier à écrire. Lancez opencode, tapez /connect, cherchez le fournisseur, collez la clé, puis choisissez le modèle avec /models.
opencode
# dans OpenCode :
/connect # cherchez par exemple « Z.AI Coding Plan », puis collez la clé
/models # choisissez GLM-5.3
Les noms à chercher, tels que les affiche le catalogue d’OpenCode : Xiaomi Token Plan (Europe), (Singapore) ou (China) selon l’adresse de votre console, Xiaomi pour l’API à l’usage, Z.AI Coding Plan ou Z.AI, Kimi For Coding, MiniMax Token Plan (minimax.io) pour le M Plan, DeepSeek, Alibaba Coding Plan et OpenCode Go. Les clés sont rangées dans ~/.local/share/opencode/auth.json.
MiMo Code, l’agent de Xiaomi, est un dérivé d’OpenCode : même interface, mêmes commandes, avec Xiaomi branché d’office.
curl -fsSL https://mimo.xiaomi.com/install | bash # installe la commande mimo
mimo auth login # choisissez MiMo, connexion par le navigateur
cd ~/projets/mon-projet && mimo # puis /models pour changer de modèle
Codex ne parle qu’un seul protocole, l’API Responses d’OpenAI : wire_api = "responses" est la seule valeur acceptée. Xiaomi, Z.ai, Kimi et DeepSeek l’exposent. On déclare le fournisseur dans ~/.codex/config.toml, puis on le choisit dans un profil, un petit fichier qui se superpose à la configuration le temps d’une session. Exemple avec Kimi Code, d’après sa documentation :
# ~/.codex/config.toml : déclare le fournisseur sans en faire le défaut
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.kimi.ai/coding/v1" # hors de Chine ; api.kimi.com en Chine
env_key = "KIMI_API_KEY" # Codex lit la clé dans cette variable
wire_api = "responses"
# ~/.codex/kimi.config.toml : le profil « kimi »
model_provider = "kimi"
model = "k3-256k"
model_catalog_json = "~/.codex/models.json" # fiche des modèles fournie par Kimi
export KIMI_API_KEY="votre_cle_kimi" # à mettre dans ~/.bashrc pour la garder
codex --profile kimi # « codex » tout court reste sur OpenAI
Le fichier models.json décrit les modèles à Codex (taille du contexte, niveaux de réflexion) : copiez celui de la documentation de l’éditeur. Les autres adresses compatibles Responses : https://api.z.ai/api/v1 chez Z.ai, https://api.xiaomimimo.com/v1 (à l’usage) ou https://token-plan-ams.xiaomimimo.com/v1 (forfait, région Europe) chez Xiaomi, https://api.deepseek.com/ chez DeepSeek.
Vos données : où elles vont, ce qu’on en fait
Un modèle ouvert et un service en ligne, ce n’est pas la même chose. Les poids de GLM ou de Qwen se téléchargent et tournent n’importe où. Quand vous passez par l’API ou le forfait de l’éditeur, votre code part chez lui, et ce sont ses conditions qui s’appliquent. Voici ce qu’elles disent, lues le 1er octobre 2026 sur les pages officielles :
| Offre | Où passent vos requêtes | Entraînement sur vos contenus |
|---|---|---|
| Xiaomi (API, Token Plan) | Chine, Singapour ou Europe selon la grappe ; hors de Chine continentale, le contrat prévoit un stockage en Europe et à Singapour | Pas sans votre accord préalable, d’après la politique de la plateforme, qui vise toutefois l’usage en Chine ; la version pour l’étranger reste introuvable |
| Z.ai (GLM) | Singapour, « en général » | Pas sans accord explicite pour les clients de l’API ; possible pour les comptes de particuliers. Les conditions ne disent pas dans quelle case tombe le GLM Coding Plan |
| Moonshot (Kimi) | Singapour pour la plateforme d’API ; pour Kimi Code, seule la politique de l’entité de Pékin (stockage en Chine) est en ligne | Permis par les conditions de l’API sauf accord écrit contraire, alors qu’une autre page de la même documentation dit l’inverse pour les entreprises |
| MiniMax | Un centre de données aux États-Unis, d’après sa politique de confidentialité | Entrées et réponses peuvent servir à améliorer les services ; aucune option de refus trouvée |
| Alibaba Cloud (Token Plan) | Région Singapour, inférence « Global » : les requêtes passent les frontières | Pas sans votre accord, d’après les conditions du produit |
| DeepSeek | Chine, pour le stockage comme pour le traitement | Oui, avec un droit de refus prévu par la politique |
Pour ces offres internationales, le contrat est signé avec une société de Singapour (Alibaba passe par sa filiale néerlandaise pour une adresse de facturation européenne), sauf DeepSeek, qui contracte depuis Hangzhou sous droit chinois.
Rien de tout ça n’est propre à la Chine : chez n’importe quel fournisseur en ligne, américain compris, votre code quitte la machine et dépend de conditions que vous ne contrôlez pas. Ce qui pèse ici : des maisons mères chinoises, des conditions qui se contredisent parfois d’une page à l’autre, et peu de prise sur elles depuis l’Europe. La bonne attitude tient en une règle : n’envoyer à ces services que ce que vous publieriez sans regret.
Toutes les commandes de cette fiche
Questions fréquentes
Où se sent l'écart entre un modèle chinois et Claude ou GPT ?
Sur les tâches longues et difficiles : un gros refactoring, un bug vicieux, une architecture à concevoir. Pour le code courant, l'écart d'une dizaine de points au classement se voit beaucoup moins que sur la facture. Chaque score a d'ailleurs sa marge d'erreur, que Quelle IA publie pour chaque modèle.
Peut-on utiliser un forfait de code chinois dans un script ou une application ?
En général non : ces forfaits servent à coder dans un outil. Xiaomi et Alibaba interdisent d'utiliser la clé du forfait dans un script automatisé ou le serveur d'une application, Z.ai interdit l'appel direct depuis vos applications ou robots, et MiniMax renvoie la production vers le paiement à l'usage. Pour un robot qui tourne la nuit, prenez l'API à l'usage.
Quel modèle chinois faire tourner en local sur un mini-PC ?
Les grands modèles comme Kimi K3, GLM-5.3 ou MiMo-V2.6-Pro demandent plusieurs centaines de gigaoctets de mémoire, hors de portée d'un mini-PC. Leurs petits cousins tiennent très bien avec Ollama : Qwen3.5-9B avec 16 Go de mémoire, Qwen 3.8 27B avec 32 Go de mémoire unifiée ou une carte graphique de 24 Go, Qwen3.5-35B-A3B à partir de 64 Go. Même sur une machine de 128 Go, Qwen 3.8 27B reste le mieux noté qui tienne.
Un modèle Ollama avec l'étiquette :cloud tourne-t-il en local ?
Non. Sur la bibliothèque d'Ollama, kimi-k3 et minimax-m3 n'existent qu'en version :cloud : la commande ollama run kimi-k3:cloud envoie la requête aux serveurs d'Ollama Cloud, hébergés surtout aux États-Unis d'après Ollama. C'est pratique, mais vos données quittent la machine.
DeepSeek utilise-t-il vos données pour entraîner ses modèles ?
Oui d'après sa politique, lue le 1er octobre 2026, avec un droit de refus prévu. DeepSeek stocke et traite les requêtes en Chine et contracte depuis Hangzhou, sous droit chinois. Pour du code sensible, seul un modèle ouvert qui tourne sur votre propre machine avec Ollama garantit que rien ne sort.
Les termes de cette fiche : Claude CodeOpenCodeCodexAgentAPIAbonnement de codeAPI unifiéeTokenInférence
Une erreur ?
Une commande ne marche plus, un prix a changé ?
Les outils bougent tous les mois. Dites-moi ce qui cloche dans cette fiche, je corrige et je redate.