Tutoriel

Statut éditorial : En attente de relecture

Installer et configurer Ollama

Installer Ollama sur macOS, Linux ou Windows, lancer un premier modèle et vérifier l’API locale sans exposer inutilement le service.

Classification du contenu

Types

  • Intelligence artificielle
  • outils
Niveau
Débutant
Prochaine vérification
10 novembre 2026

Ollama permet d’exécuter des modèles de langage sur votre machine et expose une API locale. Ce tutoriel garde le service accessible uniquement depuis la machine : n’ouvrez pas le port 11434 sur Internet sans authentification et contrôle réseau.

Vérifier les prérequis

Prévoyez plusieurs gigaoctets d’espace disque. La mémoire nécessaire dépend du modèle, de sa quantification et de la longueur de contexte. Sur macOS, la documentation officielle demande macOS Sonoma ou plus récent ; Apple Silicon bénéficie de l’accélération GPU, tandis qu’un Mac Intel fonctionne sur CPU.

Installer

Sur macOS ou Windows, téléchargez l’application depuis le site officiel. Sur Linux, utilisez l’installateur officiel :

curl -fsSL https://ollama.com/install.sh | sh
ollama -v

Sur un serveur Linux, vérifiez ensuite le service :

sudo systemctl status ollama

Lancer un premier modèle

Choisissez un modèle dont la taille est compatible avec votre mémoire, puis lancez-le :

ollama run gemma3

La première exécution télécharge les poids. Échangez avec le modèle, puis quittez l’interface avec /bye. Listez les modèles installés avec ollama list.

Tester l’API locale

Par défaut, l’API répond sur http://localhost:11434/api :

curl http://localhost:11434/api/chat -d '{
  "model": "gemma3",
  "messages": [{"role": "user", "content": "Réponds en une phrase."}],
  "stream": false
}'

Une réponse JSON confirme que le serveur, le modèle et l’API fonctionnent.

Configurer stockage et contexte

Les modèles occupent souvent des dizaines de gigaoctets. Utilisez OLLAMA_MODELS pour déplacer leur stockage. La longueur de contexte augmente aussi la consommation mémoire ; réglez-la volontairement avec OLLAMA_CONTEXT_LENGTH ou num_ctx, puis mesurez l’effet.

Sur Linux avec systemd, ajoutez les variables via systemctl edit ollama.service, rechargez puis redémarrez le service. Sur macOS, une application lancée graphiquement reçoit ses variables via launchctl.

Ne pas exposer le service par accident

La valeur par défaut locale est adaptée au développement. OLLAMA_HOST=0.0.0.0:11434 rend le service joignable sur toutes les interfaces : ne l’utilisez que derrière un pare-feu, un proxy authentifié et une politique d’accès explicite.

Diagnostic rapide

Si le modèle est lent, vérifiez les journaux, l’utilisation GPU, la mémoire disponible et la taille de contexte. Si le GPU n’est pas détecté après une veille sous Linux, la documentation indique qu’Ollama peut basculer sur le CPU. Commencez par un petit modèle avant d’augmenter la taille.

Vous disposez maintenant d’une installation locale vérifiée par la CLI et l’API. L’étape suivante consiste à appeler cette API depuis votre application.