Ollama permet d’exécuter des modèles de langage sur votre machine et expose une API locale. Ce tutoriel garde le service accessible uniquement depuis la machine : n’ouvrez pas le port 11434 sur Internet sans authentification et contrôle réseau.
Vérifier les prérequis
Prévoyez plusieurs gigaoctets d’espace disque. La mémoire nécessaire dépend du modèle, de sa quantification et de la longueur de contexte. Sur macOS, la documentation officielle demande macOS Sonoma ou plus récent ; Apple Silicon bénéficie de l’accélération GPU, tandis qu’un Mac Intel fonctionne sur CPU.
Installer
Sur macOS ou Windows, téléchargez l’application depuis le site officiel. Sur Linux, utilisez l’installateur officiel :
curl -fsSL https://ollama.com/install.sh | sh
ollama -vSur un serveur Linux, vérifiez ensuite le service :
sudo systemctl status ollamaLancer un premier modèle
Choisissez un modèle dont la taille est compatible avec votre mémoire, puis lancez-le :
ollama run gemma3La première exécution télécharge les poids. Échangez avec le modèle, puis quittez l’interface avec /bye. Listez les modèles installés avec ollama list.
Tester l’API locale
Par défaut, l’API répond sur http://localhost:11434/api :
curl http://localhost:11434/api/chat -d '{
"model": "gemma3",
"messages": [{"role": "user", "content": "Réponds en une phrase."}],
"stream": false
}'Une réponse JSON confirme que le serveur, le modèle et l’API fonctionnent.
Configurer stockage et contexte
Les modèles occupent souvent des dizaines de gigaoctets. Utilisez OLLAMA_MODELS pour déplacer leur stockage. La longueur de contexte augmente aussi la consommation mémoire ; réglez-la volontairement avec OLLAMA_CONTEXT_LENGTH ou num_ctx, puis mesurez l’effet.
Sur Linux avec systemd, ajoutez les variables via systemctl edit ollama.service, rechargez puis redémarrez le service. Sur macOS, une application lancée graphiquement reçoit ses variables via launchctl.
Ne pas exposer le service par accident
La valeur par défaut locale est adaptée au développement. OLLAMA_HOST=0.0.0.0:11434 rend le service joignable sur toutes les interfaces : ne l’utilisez que derrière un pare-feu, un proxy authentifié et une politique d’accès explicite.
Diagnostic rapide
Si le modèle est lent, vérifiez les journaux, l’utilisation GPU, la mémoire disponible et la taille de contexte. Si le GPU n’est pas détecté après une veille sous Linux, la documentation indique qu’Ollama peut basculer sur le CPU. Commencez par un petit modèle avant d’augmenter la taille.
Vous disposez maintenant d’une installation locale vérifiée par la CLI et l’API. L’étape suivante consiste à appeler cette API depuis votre application.