Ollama & les modèles locaux
Faire tourner de vrais modèles d'IA chez vous, gratuitement et en privé. Installation, premier modèle, et comment brancher ça à votre agent de code.
Sur cette fiche
Fiche vérifiée il y a 3 mois : certaines commandes ont pu changer. Signalez-le si c’est le cas.
En bref
Ollama fait tourner des modèles d'IA ouverts sur votre machine : une commande pour l'installer, une pour lancer un modèle, et une API locale sur le port 11434, compatible OpenAI et Anthropic. Pour commencer, qwen3.5:9b tient dans 16 Go et qwen3.8:27b demande une carte graphique de 24 Go ou 32 Go de mémoire unifiée. OpenCode s'y branche nativement, Claude Code aussi depuis Ollama 0.15 avec ollama launch claude, et Codex avec ollama launch codex ou codex --oss. Fixez vous-même la taille du contexte, car le réglage par défaut dépend de la mémoire et grimpe à 256 000 jetons sur les grosses machines.
À faire avant : Choisir et dimensionner son modèle
Jusqu’ici, votre agent de code parlait à des modèles dans le cloud. Maintenant on fait tourner de vrais modèles d’IA directement sur votre mini-PC. Et le truc qui rend ça possible sans douleur, c’est Ollama.
Ollama, c’est la façon la plus simple d’exécuter des LLM open-weight en local. Une commande pour l’installer, une pour télécharger un modèle, et vous vous retrouvez avec une API locale sur le port 11434 qui parle le format OpenAI et, depuis Ollama 0.14 (janvier 2026), celui d’Anthropic : à peu près tous les outils du marché savent s’y brancher. Trois avantages qui se passent de commentaire : c’est privé (rien ne quitte la machine), c’est gratuit, et ça marche hors-ligne.
Installer Ollama
Une ligne. Le script installe le binaire et le lance comme service système, il tourne en fond, prêt à répondre.
curl -fsSL https://ollama.com/install.sh | sh
C’est tout. Ollama écoute désormais sur http://localhost:11434.
Votre premier modèle
On commence par un modèle qui tient presque partout : qwen3.5:9b, 9 milliards de paramètres, 6,6 Go à télécharger. Au classement de Quelle IA (édition du 28 septembre 2026), c’est le mieux noté qui tient dans 8 à 14 Go de mémoire utile, donc le bon choix pour une machine de 16 Go.
# le point de départ, pour une machine de 16 Go
ollama run qwen3.5:9b
# avec 24 Go de mémoire graphique ou 32 Go de mémoire unifiée et plus
ollama run qwen3.8:27b
qwen3.8:27b (18 Go) est, à la même date, le mieux noté qui tient d’une carte graphique de 24 Go jusqu’à un mini-PC de 128 Go. Ces recommandations bougent vite : pour la vôtre, passez par Trouver mon modèle ou par le classement des modèles locaux de Quelle IA. Le détail est dans Choisir son modèle local.
Le premier lancement télécharge le modèle (quelques Go, soyez patient). Ensuite vous vous retrouvez dans un chat directement en terminal : posez-lui une question, demandez-lui un bout de code, vérifiez que ça répond. Tapez /bye pour sortir.
0 étape sur 3 faite Vos cases cochées restent dans ce navigateur.
-
Voir ce que vous avez
ollama list # tous les modèles téléchargés, avec leur taille -
Voir ce qui tourne
ollama ps # les modèles chargés en mémoire là, maintenant -
Faire le ménage
ollama rm qwen3.5:9b # supprime un modèle pour récupérer de la place
Brancher ça à votre agent de code
Les trois agents se branchent sur Ollama, chacun par son chemin. Ils ne proposent pas tous les mêmes modèles en ligne : la page Outils de code de Quelle IA dit ce que chacun accepte, clé personnelle et modèles locaux compris. Dans tous les cas, gardez en tête qu’un modèle local reste en dessous des meilleurs modèles en ligne pour le code : regardez l’écart sur le classement code de Quelle IA avant d’en attendre des miracles.
Claude Code se branche sur Ollama. Depuis la version 0.14, Ollama parle l’API d’Anthropic, et depuis la 0.15 une commande fait tout le branchement :
ollama launch claude # choisit un modèle et lance Claude Code dessus
ollama launch claude --model qwen3.8:27b # ou directement avec le modèle voulu
Sans ollama launch, trois variables suffisent, le temps d’une session :
export ANTHROPIC_AUTH_TOKEN=ollama # exigé, mais ignoré par Ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.8:27b
Choisissez un modèle qui sait appeler des outils, et montez le contexte à 64 000 jetons au moins : la doc d’Ollama le recommande pour Claude Code. Comptez aussi avec l’écart de niveau : le harnais est le même, le cerveau est plus modeste. Pour les gros chantiers, le raisonnement long et la fiabilité au top, Claude Code sur les modèles d’Anthropic reste devant.
L’API locale d’Ollama sert aussi aux tâches annexes, sans changer de modèle dans Claude Code : embeddings, classification rapide, résumés, petits scripts qui tapent sur http://localhost:11434 sans coûter un centime ni envoyer vos données ailleurs. Le cloud pour le cerveau, le local pour la plomberie.
C’est le chemin royal vers un agent de code 100 % local. OpenCode parle nativement à Ollama. Le plus court, depuis Ollama 0.15 :
ollama launch opencode # choisit le modèle et lance OpenCode, sans toucher à votre config
À la main, vous déclarez Ollama comme fournisseur dans opencode.json, en le pointant sur l’API locale :
http://localhost:11434/v1
puis vous choisissez le modèle local avec /models, par exemple qwen3.8:27b. OpenCode demande un contexte d’au moins 64 000 jetons (voir les réglages plus bas). À partir de là, votre agent réfléchit, lit votre code et écrit des fichiers sans qu’un octet ne sorte de la machine. Gratuit, privé, hors-ligne. C’est exactement le scénario pour lequel OpenCode existe.
Codex connaît Ollama d’origine : c’est un de ses fournisseurs « open source » intégrés, qu’on active avec --oss. Le plus court passe par Ollama lui-même :
ollama launch codex # Ollama prépare un profil Codex dédié et lance la session
À la main, une option suffit :
codex --oss -m qwen3.8:27b # session interactive sur le modèle local
codex exec --oss -m qwen3.8:27b "Résume le README" # même chose en non interactif
Pour ne pas répéter le choix du fournisseur, posez oss_provider = "ollama" dans ~/.codex/config.toml : sans lui, la session interactive vous demande de choisir entre Ollama et LM Studio, et codex exec --oss s’arrête sur une erreur. La doc d’Ollama demande ici aussi un contexte d’au moins 64 000 jetons. Même mise en garde que pour Claude Code : le harnais est le même, le modèle est plus modeste que ceux d’OpenAI.
Les trois réglages qui comptent
Ollama marche tout de suite, mais trois variables d’environnement font toute la différence quand vous le poussez. Vous les posez dans l’environnement du service (systemctl edit ollama puis Environment="...").
Le piège à graver dans votre tête
Neuf fois sur dix, quand quelqu’un dit « Ollama est lent chez moi », le coupable est le contexte réglé trop haut. Et sur une machine bien dotée, c’est désormais le réglage par défaut qui le règle trop haut.
Voilà pourquoi. Plus la fenêtre de contexte est grande, plus le cache KV (la mémoire de travail du modèle) mange de RAM, et ça grossit vite. Si vous demandez un contexte énorme sur une machine juste, vous débordez sur le swap (le disque qui sert de RAM de secours), et là tout s’effondre : le modèle rame, chaque token prend une éternité, vous croyez que votre matériel est nul alors qu’il étouffe.
La règle : réglez le contexte sur ce dont la tâche a besoin, pas sur le maximum. Un petit script ? 4096 suffit. Un agent de code sur un vrai dépôt ? 64 000, mais surveillez votre RAM : ollama ps montre la taille réellement chargée et, dans sa colonne CONTEXT, le contexte retenu. Le bon réglage, c’est le plus petit qui fait le boulot.
Toutes les commandes de cette fiche
Questions fréquentes
Pourquoi Ollama est-il si lent sur ma machine ?
Neuf fois sur dix, la fenêtre de contexte est réglée trop haut. Plus elle est grande, plus le cache KV, la mémoire de travail du modèle, mange de RAM, et sur une machine juste tout déborde sur le swap : chaque jeton prend alors une éternité. Réglez le contexte sur ce dont la tâche a besoin, et vérifiez avec ollama ps la taille réellement chargée et le contexte retenu.
Comment éviter qu'Ollama recharge le modèle à chaque requête ?
Par défaut, Ollama garde un modèle chargé 5 minutes après la dernière requête. Avec OLLAMA_KEEP_ALIVE=-1, il reste résident en permanence, ce qui devient indispensable pour un agent qui enchaîne beaucoup d'appels. La variable se pose dans l'environnement du service, avec systemctl edit ollama.
Peut-on utiliser Ollama depuis un autre appareil ?
Oui, à condition de rester dans un cadre privé : laissez l'adresse d'écoute OLLAMA_HOST sur localhost, ou passez par Tailscale pour y accéder depuis un autre appareil. N'exposez jamais le port 11434 en public, ce serait offrir votre GPU au premier venu.
Comment voir et supprimer les modèles téléchargés ?
La commande ollama list affiche tous les modèles téléchargés avec leur taille, et ollama ps ceux qui sont chargés en mémoire à l'instant. Pour récupérer de la place, ollama rm suivi du nom du modèle le supprime.
Un modèle local code-t-il aussi bien que Claude ou GPT ?
Non, un modèle local reste en dessous des meilleurs modèles en ligne pour le code : avec Claude Code ou Codex branché dessus, le harnais est le même, le modèle est plus modeste. Il a d'autres atouts : il est privé, gratuit et marche hors ligne. Il excelle aussi sur les tâches annexes comme les embeddings, la classification rapide ou les résumés.
Les termes de cette fiche : AgentOllamaLLMModèle open-weight (poids ouverts)APIParamètresGPU (carte graphique)Fenêtre de contexteToken
Une erreur ?
Une commande ne marche plus, un prix a changé ?
Les outils bougent tous les mois. Dites-moi ce qui cloche dans cette fiche, je corrige et je redate.