Une démonstration RAG peut sembler convaincante tout en récupérant les mauvais documents ou en produisant des réponses non fondées. L’évaluation doit séparer la qualité du retriever de celle du générateur et conserver les entrées intermédiaires nécessaires au diagnostic.
Construire le jeu d’évaluation
Commencez par des questions réelles et variées, avec références attendues lorsque cela est possible. Conservez la version du corpus, les documents pertinents, la réponse de référence et les cas où l’application doit admettre qu’elle ne sait pas.
Mesurer le retrieval
Évaluez pertinence, précision et rappel des contextes. Une métrique de rappel nécessite généralement une référence sur l’information attendue. Analysez les résultats par type de question, source, langue et filtre d’accès plutôt qu’une moyenne unique.
Mesurer la génération
La fidélité vérifie que la réponse est soutenue par le contexte; la pertinence mesure si elle répond à la question. Ajoutez des contrôles déterministes pour les citations, le format et les champs obligatoires. Un juge LLM reste probabiliste : calibrez-le sur des exemples relus humainement.
Ragas ou DeepEval
Ragas propose un ensemble de métriques orientées RAG et des workflows d’évaluation. DeepEval s’intègre naturellement à des tests et propose aussi des métriques RAG, agents et personnalisées. Choisissez selon votre pipeline, puis figez versions, modèle juge et prompts d’évaluation.
Bloquer les régressions
Enregistrez les scores, coûts et latences par version. Commencez par des seuils d’alerte, puis rendez bloquantes les métriques stables. Relisez systématiquement un échantillon des échecs et des succès proches du seuil.
Checklist avant mise en production
- Valider les entrées, les sorties et les permissions des outils.
- Tester les erreurs du fournisseur, les délais d’attente et les limites de coût.
- Ajouter des traces sans enregistrer de secrets ni de données personnelles inutiles.
- Mesurer la qualité sur un jeu de cas représentatifs avant chaque évolution.
Questions fréquentes
Une métrique automatique remplace-t-elle la relecture humaine ?
Non. Elle permet de répéter et comparer, mais doit être calibrée et complétée par des revues humaines.
Faut-il une réponse de référence pour chaque question ?
Pas pour toutes les métriques. La fidélité et la pertinence peuvent être évaluées sans réponse de référence, tandis que le rappel et la correction gagnent à disposer d’un ground truth.