Un GPU accélère généralement l’inférence, mais le résultat dépend du modèle, de la quantification, de la mémoire disponible et de la longueur du prompt. Un benchmark utile doit séparer le chargement, le traitement du contexte et la génération.
Mesurer les bonnes métriques
- **Temps au premier token** : délai ressenti avant le début de la réponse.
- **Débit de génération** : tokens produits par seconde.
- **Débit de prompt** : vitesse de traitement du contexte initial.
- **Mémoire maximale** : RAM et VRAM réellement utilisées.
- **Stabilité** : variance entre exécutions et erreurs sous charge.
L’API Ollama renvoie des durées et des compteurs dans sa réponse finale. Enregistrez-les avec le nom complet du modèle et la machine.
Construire un protocole reproductible
- Téléchargez une variante précise du modèle.
- Fixez le même prompt, le même contexte et le même nombre de tokens produits.
- Effectuez une exécution de chauffe.
- Lancez au moins cinq mesures et utilisez la médiane.
- Recommencez avec plusieurs longueurs de contexte.
- Surveillez RAM, VRAM, température et fréquence.
Ne comparez pas une première exécution qui charge le modèle avec une exécution déjà chaude.
Quand le GPU aide
Le GPU dispose d’une bande passante mémoire et d’un parallélisme adaptés aux calculs du modèle. Ollama prend en charge Metal sur les GPU Apple et différents backends NVIDIA, AMD ou Vulkan selon le système. Si les poids et le cache tiennent en mémoire GPU, le gain peut être important.
Quand le CPU reste pertinent
Le CPU convient aux petits modèles, aux traitements occasionnels et aux machines sans GPU compatible. Une mémoire système abondante peut permettre d’exécuter un modèle qui ne tient pas dans une petite VRAM, mais avec une génération plus lente. La quantification rend ce scénario plus praticable.
Éviter les chutes de performance
Un contexte trop grand augmente le cache mémoire. Si le modèle ne tient plus sur le GPU, une partie du calcul peut basculer ou échouer. Vérifiez le backend réellement utilisé dans les journaux et avec les outils système. Sous Linux, un GPU non détecté après veille peut conduire Ollama à utiliser le CPU.
Comparer pour votre usage
Un débit maximal ne suffit pas pour un service interactif : mesurez aussi la concurrence et le temps au premier token. Pour un traitement par lots, le débit total peut primer. Conservez les résultats avec la version d’Ollama, le système, les pilotes et les paramètres afin de pouvoir expliquer une régression.
Le bon matériel est celui qui atteint votre objectif de qualité et de latence avec une marge de mémoire suffisante, pas celui qui gagne un benchmark isolé.