Aller au contenu
Les 31 fichesFREN中文
Fiches
Partie 4 · fiche 7 sur 8 Niveau : Facile Durée de lecture : 12 min Plateformes : Linux

Ollama & les modèles locaux

Faire tourner de vrais modèles d'IA chez vous, gratuitement et en privé. Installation, premier modèle, et comment brancher ça à votre agent de code.

Sur cette fiche
  1. 01Installer Ollama
  2. 02Votre premier modèle
  3. 03Brancher ça à votre agent de code
  4. 04Les trois réglages qui comptent
  5. 05Le piège à graver dans votre tête
  6. 06Questions fréquentes

En bref

Ollama fait tourner des modèles d'IA ouverts sur votre machine : une commande pour l'installer, une pour lancer un modèle, et une API locale sur le port 11434, compatible OpenAI et Anthropic. Pour commencer, qwen3.5:9b tient dans 16 Go et qwen3.8:27b demande une carte graphique de 24 Go ou 32 Go de mémoire unifiée. OpenCode s'y branche nativement, Claude Code aussi depuis Ollama 0.15 avec ollama launch claude, et Codex avec ollama launch codex ou codex --oss. Fixez vous-même la taille du contexte, car le réglage par défaut dépend de la mémoire et grimpe à 256 000 jetons sur les grosses machines.

À faire avant : Choisir et dimensionner son modèle

Jusqu’ici, votre agent de code parlait à des modèles dans le cloud. Maintenant on fait tourner de vrais modèles d’IA directement sur votre mini-PC. Et le truc qui rend ça possible sans douleur, c’est Ollama.

Ollama, c’est la façon la plus simple d’exécuter des LLM open-weight en local. Une commande pour l’installer, une pour télécharger un modèle, et vous vous retrouvez avec une API locale sur le port 11434 qui parle le format OpenAI et, depuis Ollama 0.14 (janvier 2026), celui d’Anthropic : à peu près tous les outils du marché savent s’y brancher. Trois avantages qui se passent de commentaire : c’est privé (rien ne quitte la machine), c’est gratuit, et ça marche hors-ligne.

Installer Ollama

Une ligne. Le script installe le binaire et le lance comme service système, il tourne en fond, prêt à répondre.

curl -fsSL https://ollama.com/install.sh | sh

C’est tout. Ollama écoute désormais sur http://localhost:11434.

Votre premier modèle

On commence par un modèle qui tient presque partout : qwen3.5:9b, 9 milliards de paramètres, 6,6 Go à télécharger. Au classement de Quelle IA (édition du 28 septembre 2026), c’est le mieux noté qui tient dans 8 à 14 Go de mémoire utile, donc le bon choix pour une machine de 16 Go.

# le point de départ, pour une machine de 16 Go
ollama run qwen3.5:9b
# avec 24 Go de mémoire graphique ou 32 Go de mémoire unifiée et plus
ollama run qwen3.8:27b

qwen3.8:27b (18 Go) est, à la même date, le mieux noté qui tient d’une carte graphique de 24 Go jusqu’à un mini-PC de 128 Go. Ces recommandations bougent vite : pour la vôtre, passez par Trouver mon modèle ou par le classement des modèles locaux de Quelle IA. Le détail est dans Choisir son modèle local.

Le premier lancement télécharge le modèle (quelques Go, soyez patient). Ensuite vous vous retrouvez dans un chat directement en terminal : posez-lui une question, demandez-lui un bout de code, vérifiez que ça répond. Tapez /bye pour sortir.

0 étape sur 3 faite Vos cases cochées restent dans ce navigateur.

  1. Voir ce que vous avez

    ollama list   # tous les modèles téléchargés, avec leur taille
    
  2. Voir ce qui tourne

    ollama ps     # les modèles chargés en mémoire là, maintenant
    
  3. Faire le ménage

    ollama rm qwen3.5:9b   # supprime un modèle pour récupérer de la place
    

Brancher ça à votre agent de code

Les trois agents se branchent sur Ollama, chacun par son chemin. Ils ne proposent pas tous les mêmes modèles en ligne : la page Outils de code de Quelle IA dit ce que chacun accepte, clé personnelle et modèles locaux compris. Dans tous les cas, gardez en tête qu’un modèle local reste en dessous des meilleurs modèles en ligne pour le code : regardez l’écart sur le classement code de Quelle IA avant d’en attendre des miracles.

Claude Code se branche sur Ollama. Depuis la version 0.14, Ollama parle l’API d’Anthropic, et depuis la 0.15 une commande fait tout le branchement :

ollama launch claude                       # choisit un modèle et lance Claude Code dessus
ollama launch claude --model qwen3.8:27b   # ou directement avec le modèle voulu

Sans ollama launch, trois variables suffisent, le temps d’une session :

export ANTHROPIC_AUTH_TOKEN=ollama        # exigé, mais ignoré par Ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3.8:27b

Choisissez un modèle qui sait appeler des outils, et montez le contexte à 64 000 jetons au moins : la doc d’Ollama le recommande pour Claude Code. Comptez aussi avec l’écart de niveau : le harnais est le même, le cerveau est plus modeste. Pour les gros chantiers, le raisonnement long et la fiabilité au top, Claude Code sur les modèles d’Anthropic reste devant.

L’API locale d’Ollama sert aussi aux tâches annexes, sans changer de modèle dans Claude Code : embeddings, classification rapide, résumés, petits scripts qui tapent sur http://localhost:11434 sans coûter un centime ni envoyer vos données ailleurs. Le cloud pour le cerveau, le local pour la plomberie.

Les trois réglages qui comptent

Ollama marche tout de suite, mais trois variables d’environnement font toute la différence quand vous le poussez. Vous les posez dans l’environnement du service (systemctl edit ollama puis Environment="...").

Le piège à graver dans votre tête

Neuf fois sur dix, quand quelqu’un dit « Ollama est lent chez moi », le coupable est le contexte réglé trop haut. Et sur une machine bien dotée, c’est désormais le réglage par défaut qui le règle trop haut.

Voilà pourquoi. Plus la fenêtre de contexte est grande, plus le cache KV (la mémoire de travail du modèle) mange de RAM, et ça grossit vite. Si vous demandez un contexte énorme sur une machine juste, vous débordez sur le swap (le disque qui sert de RAM de secours), et là tout s’effondre : le modèle rame, chaque token prend une éternité, vous croyez que votre matériel est nul alors qu’il étouffe.

La règle : réglez le contexte sur ce dont la tâche a besoin, pas sur le maximum. Un petit script ? 4096 suffit. Un agent de code sur un vrai dépôt ? 64 000, mais surveillez votre RAM : ollama ps montre la taille réellement chargée et, dans sa colonne CONTEXT, le contexte retenu. Le bon réglage, c’est le plus petit qui fait le boulot.

Questions fréquentes

Pourquoi Ollama est-il si lent sur ma machine ?

Neuf fois sur dix, la fenêtre de contexte est réglée trop haut. Plus elle est grande, plus le cache KV, la mémoire de travail du modèle, mange de RAM, et sur une machine juste tout déborde sur le swap : chaque jeton prend alors une éternité. Réglez le contexte sur ce dont la tâche a besoin, et vérifiez avec ollama ps la taille réellement chargée et le contexte retenu.

Comment éviter qu'Ollama recharge le modèle à chaque requête ?

Par défaut, Ollama garde un modèle chargé 5 minutes après la dernière requête. Avec OLLAMA_KEEP_ALIVE=-1, il reste résident en permanence, ce qui devient indispensable pour un agent qui enchaîne beaucoup d'appels. La variable se pose dans l'environnement du service, avec systemctl edit ollama.

Peut-on utiliser Ollama depuis un autre appareil ?

Oui, à condition de rester dans un cadre privé : laissez l'adresse d'écoute OLLAMA_HOST sur localhost, ou passez par Tailscale pour y accéder depuis un autre appareil. N'exposez jamais le port 11434 en public, ce serait offrir votre GPU au premier venu.

Comment voir et supprimer les modèles téléchargés ?

La commande ollama list affiche tous les modèles téléchargés avec leur taille, et ollama ps ceux qui sont chargés en mémoire à l'instant. Pour récupérer de la place, ollama rm suivi du nom du modèle le supprime.

Un modèle local code-t-il aussi bien que Claude ou GPT ?

Non, un modèle local reste en dessous des meilleurs modèles en ligne pour le code : avec Claude Code ou Codex branché dessus, le harnais est le même, le modèle est plus modeste. Il a d'autres atouts : il est privé, gratuit et marche hors ligne. Il excelle aussi sur les tâches annexes comme les embeddings, la classification rapide ou les résumés.

Les termes de cette fiche : AgentOllamaLLMModèle open-weight (poids ouverts)APIParamètresGPU (carte graphique)Fenêtre de contexteToken

Une erreur ?

Une commande ne marche plus, un prix a changé ?

Les outils bougent tous les mois. Dites-moi ce qui cloche dans cette fiche, je corrige et je redate.

Seuls la page, votre message et le contact éventuel sont gardés. Rien d’autre.

Fiche 25 sur 31 · partie 4 aucune fiche lue pour l’instant Ouvrir le sommaire des fiches