L'hybride : cloud + local
Le meilleur des deux mondes. Un modèle frontière pris en abonnement (Claude, GPT, Grok ou Gemini) planifie, raisonne et relit, et délègue le gros œuvre répétitif à un modèle local. Privé, économe, et redoutablement efficace.
Sur cette fiche
Fiche vérifiée il y a 3 mois : certaines commandes ont pu changer. Signalez-le si c’est le cas.
En bref
Le montage hybride confie le raisonnement difficile, l'architecture et la relecture à un modèle frontière pris en abonnement (Claude avec Claude Code, GPT avec Codex, Grok avec Grok Build, Gemini avec Antigravity CLI), et le travail répétitif, sensible ou hors-ligne à un modèle local servi par Ollama. Claude Code orchestre : il écrit les scripts qui appellent l'API locale sur le port 11434. Depuis Ollama 0.15, Claude Code peut aussi tourner lui-même sur le modèle local avec ollama launch claude, pour le code qui ne doit pas sortir ou quand la connexion manque. La règle d'or : ne déléguer au local que des tâches bien bornées, et faire relire le résultat.
À faire avant : Ollama & les modèles locaux
Vous avez maintenant deux mondes sous la main. D’un côté, les modèles frontières des grands éditeurs, pris en abonnement avec leur agent de code : Claude avec Claude Code, GPT avec Codex, Grok avec Grok Build, Gemini avec Antigravity CLI. De l’autre, des modèles qui tournent gratuitement chez vous (Ollama). La fausse question, c’est « lequel choisir ? ». La vraie réponse, c’est : les deux, en même temps, chacun à sa place.
C’est le montage hybride, et c’est la façon la plus efficace de travailler avec un mini-PC. La machine orchestre : elle fait tourner les agents, garde vos projets et vos scripts. Le forfait frontière, à prix fixe chaque mois (20 $ pour Claude Pro ou ChatGPT Plus, 30 $ pour SuperGrok, 21,99 € pour Google AI Pro, prix relevés le 1er octobre 2026), fait le gros du raisonnement. Le modèle local prend le confidentiel, le répétitif et le hors-ligne. Les paliers, les limites et ce que chaque éditeur autorise sont comparés dans Les modèles frontières en abonnement.
Les exemples de cette fiche mettent Claude Code en chef d’orchestre, parce que c’est le montage le plus rodé ; il se transpose tel quel à Codex ou à OpenCode. L’agent cloud décide qui fait quoi, et délègue le travail en volume au modèle local.
- Claude· Claude Code
- ChatGPT· Codex
- Grok· Grok Build
- Gemini· Antigravity CLI
- gemma4:26b
- qwen3.8:27b
- nomic-embed-text
Pourquoi mélanger plutôt que choisir
Les deux mondes ont des forces opposées, et c’est précisément ce qui les rend complémentaires :
- Le cloud (Claude, GPT, Grok, Gemini) est imbattable sur le raisonnement difficile, les tâches longues, le tool use fiable, l’architecture. Mais le forfait a des plafonds (par tranche de 5 heures et par semaine), l’API se paie au jeton, et vos données partent chez un tiers.
- Le local (Ollama) est gratuit à l’usage, privé, dispo hors-ligne, et largement assez bon pour les tâches bornées et répétitives. Mais il fatigue sur l’agentique longue et le raisonnement de pointe (on en a parlé sans détour dans Choisir son modèle, et le classement des modèles locaux de Quelle IA chiffre l’écart).
Le montage hybride prend le meilleur de chacun : vous gardez l’intelligence de pointe là où elle compte vraiment, et vous faites tomber le coût et les fuites de données sur tout le reste, c’est-à-dire 80 % du volume.
Claude Code en orchestrateur : comment ça marche
Le truc qui rend ça possible : Claude Code peut lancer des commandes. Et Ollama expose une API locale toute simple sur http://localhost:11434. Donc Claude Code peut appeler votre modèle local, via un curl, un script, ou un petit outil, exactement comme il appellerait n’importe quelle commande.
Concrètement, vous dites à Claude : « pour cette tâche en volume, ne la fais pas toi-même, délègue-la au modèle local via l’API Ollama ». Il écrit le script qui boucle sur vos fichiers, tape le modèle local pour chacun, et vous ramène le résultat consolidé. Lui garde la vision d’ensemble ; le local abat le travail.
# Le geste de base que Claude Code orchestre : appeler le modèle local (ici gemma4:26b, rapide)
curl -s http://localhost:11434/api/generate -d '{
"model": "gemma4:26b",
"prompt": "Résume ce fichier en 3 puces : '"$(cat rapport.md)"'",
"stream": false
}' | jq -r .response
Quatre façons concrètes de router le travail
0 étape sur 4 faite Vos cases cochées restent dans ce navigateur.
-
Router par coût : le volume au local, la pointe au cloud
Vous devez reformuler 300 descriptions produit, classer 2 000 commentaires, ou générer du boilerplate à la chaîne ? C’est répétitif et borné : modèle local. Vous devez concevoir l’architecture du module ou débugger une race condition vicieuse ? C’est rare et difficile : Claude. Claude écrit le pipeline, le local fait tourner les 300 appels gratuitement.
-
Router par confidentialité : le sensible reste à la maison
Du code propriétaire, des données clients, des trucs qui ne doivent pas sortir ? Vous les faites traiter par le modèle local : rien ne quitte la machine. Claude garde un rôle de coordination sur la partie non sensible. Et si le travail sensible demande un vrai agent, lancez une session à part avec
ollama launch claude: même Claude Code, mais les requêtes au modèle restent chez vous. C’est un argument fort en contexte pro (cf. Sécuriser les accès). -
Le RAG maison : embeddings locaux, raisonnement cloud
Vous voulez que l’agent connaisse votre corpus (votre doc, vos articles, votre code) ? Générez les embeddings en local avec Ollama (
nomic-embed-textou équivalent), stockez-les, et laissez Claude raisonner sur les passages les plus pertinents que vous lui servez. Le maillage et l’indexation, gratuits et privés en local ; l’intelligence finale, côté Claude. -
Le filet hors-ligne : OpenCode + local prend le relais
Plus de connexion ? Train, avion, panne ? Vous basculez sur OpenCode branché sur votre modèle local, ou sur Claude Code lui-même avec
ollama launch claude, et vous continuez à coder. Le cloud n’est plus un point de défaillance unique : votre machine reste un atelier autonome.
Brancher les deux, en pratique
Claude Code est l’orchestrateur par défaut. Vous n’avez rien de spécial à installer : il sait déjà lancer des commandes, donc il sait déjà appeler Ollama. Donnez-lui simplement la consigne dans votre CLAUDE.md :
# Stratégie hybride
- Pour les tâches répétitives et en volume (reformulation, classification,
résumés, génération de boilerplate), délègue au modèle local via l'API
Ollama (http://localhost:11434), ne les fais pas toi-même.
- Garde pour toi le raisonnement complexe, l'architecture et la revue.
- Le code et les données marqués « sensibles » : modèle local uniquement.
Désormais, quand vous lui confiez un gros lot, il écrit le script qui tape le local et vous ramène le résultat. Vous pilotez, il répartit.
Le second montage, depuis Ollama 0.15 : Claude Code entier sur le modèle local. Ollama parle l’API d’Anthropic, et une commande fait le branchement :
# une session Claude Code dont le cerveau est local
ollama launch claude --model qwen3.8:27b
Gardez deux terminaux : la session habituelle sur les modèles d’Anthropic pour l’architecture et la revue, et cette session locale pour le code sensible ou hors-ligne. Prévoyez un contexte d’au moins 64 000 jetons et un modèle qui sait appeler des outils (détails dans Ollama & les modèles locaux). Les requêtes au modèle ne sortent pas ; Claude Code envoie encore de la télémétrie de fonctionnement, sans code ni prompts d’après sa documentation, que CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 coupe.
OpenCode rend le routage explicite : vous changez de modèle selon la tâche. Branchez à la fois un fournisseur cloud (Anthropic/OpenRouter) et Ollama en local, puis basculez via /models :
- tâche difficile, raisonnement, archi → modèle cloud ;
- tâche en volume, sensible, ou hors-ligne → votre modèle local.
C’est l’approche idéale si vous voulez voir et maîtriser quel modèle traite quoi, plutôt que de laisser un orchestrateur décider. Et pour savoir quels autres outils de code acceptent un modèle local (et lesquels le refusent), Quelle IA tient la liste à jour. Et si Claude Code reste votre chef d’orchestre, OpenCode + local fait un excellent « bras » que Claude peut invoquer en ligne de commande.
Toutes les commandes de cette fiche
Questions fréquentes
Combien coûte un abonnement à un modèle frontière ?
Au 1er octobre 2026, comptez 20 $ par mois pour Claude Pro ou ChatGPT Plus, 30 $ pour SuperGrok et 21,99 € pour Google AI Pro. Le prix est fixe, mais le forfait a des plafonds d'usage, par tranche de 5 heures et par semaine. C'est une raison de plus pour confier le travail en volume à un modèle local, gratuit à l'usage.
Comment dire à Claude Code de déléguer au modèle local ?
Écrivez la consigne une fois dans le fichier CLAUDE.md du projet : les tâches répétitives et en volume partent vers le modèle local via l'API Ollama sur http://localhost:11434, le raisonnement complexe, l'architecture et la revue restent à Claude, et les données marquées sensibles ne vont qu'au local. Quand vous lui confiez ensuite un gros lot, il écrit lui-même le script qui appelle le modèle local et vous ramène le résultat.
Comment faire un RAG avec un modèle local ?
Générez les embeddings de votre corpus en local avec Ollama, par exemple avec nomic-embed-text, et stockez-les. Vous servez ensuite à Claude les passages les plus pertinents, et c'est lui qui raisonne dessus. L'indexation reste gratuite et privée sur votre machine, seule la réflexion finale passe par le cloud.
Si Claude Code tourne sur un modèle local, envoie-t-il encore des données ?
Les requêtes au modèle restent sur votre machine. Claude Code envoie encore de la télémétrie de fonctionnement, sans code ni prompts d'après sa documentation. La variable CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 la coupe.
Peut-on choisir soi-même quel modèle traite chaque tâche ?
Oui, avec OpenCode : vous y branchez à la fois un fournisseur cloud et Ollama en local, puis vous basculez de l'un à l'autre avec /models. Le cloud prend les tâches difficiles, le local les tâches en volume, sensibles ou hors ligne. C'est la bonne approche si vous voulez voir et maîtriser qui traite quoi au lieu de laisser un orchestrateur décider.
Les termes de cette fiche : AgentCodexGrok BuildAntigravity CLIClaude CodeOpenCodeAPIOllama
Une erreur ?
Une commande ne marche plus, un prix a changé ?
Les outils bougent tous les mois. Dites-moi ce qui cloche dans cette fiche, je corrige et je redate.