Nouveau · Présidentielle 2027 : ce que les candidats proposent sur l'IA, citations sourcées. Explorer l'observatoire →

Dernière revue :

Qu'est-ce que l'évaluation des LLM ? Définition des evals et du LLM as a judge

L'évaluation des LLM (les « evals ») consiste à mesurer la qualité des réponses d'un modèle ou d'un assistant IA sur un jeu de cas représentatifs, avec des critères de réussite fixés à l'avance. Le LLM as a judge en est une méthode : un second modèle note les réponses du premier, ce qui permet d'évaluer à grande échelle, au prix de biais connus.

Un classement public (benchmark) dit peu de choses sur votre cas d'usage. Pour décider si un assistant IA peut passer en production, il faut une évaluation propre à votre métier. Elle repose sur trois éléments. D'abord des critères de succès précis et mesurables : exactitude, ton, absence de données personnelles, latence, coût. Anthropic recommande d'éviter les objectifs vagues comme « bonne performance ». Ensuite un jeu de tests qui reflète la distribution réelle des demandes, cas limites compris. Enfin une méthode de notation : comparaison automatique avec la réponse attendue quand c'est possible, relecture humaine sur un échantillon, ou notation par un autre modèle. Cette dernière méthode, le LLM as a judge, a été étudiée par Zheng et al. (2023) : GPT-4 utilisé comme juge rejoint les préférences humaines dans plus de 80 % des cas, soit le niveau d'accord observé entre humains. Les auteurs décrivent aussi trois biais : le biais de position (préférer la réponse présentée en premier), le biais de verbosité (préférer la plus longue) et l'auto-complaisance (préférer ses propres réponses). D'où la recommandation d'Anthropic : utiliser pour noter un modèle différent de celui qui produit. Les evals ne s'arrêtent pas au lancement. Elles se rejouent à chaque changement de modèle, de prompt ou de données. En avril 2025, OpenAI a dû retirer une mise à jour de GPT-4o jugée trop complaisante : ses evals hors ligne et ses tests A/B étaient bons, mais aucune eval de déploiement ne mesurait la complaisance.

Exemple concret

Cas illustratif : une mutuelle régionale prépare un assistant qui répond aux adhérents sur leurs garanties. Avant le lancement, l'équipe réunit 400 questions réelles tirées de l'historique du service client, dont 60 cas pièges (garanties résiliées, questions médicales, demandes hors périmètre). Deux gestionnaires rédigent la réponse attendue pour chacune. Les réponses de l'assistant sont notées de trois façons : vérification automatique des montants de remboursement, notation de la clarté et du ton par un modèle d'un autre fournisseur, relecture humaine de 10 % des cas tirés au hasard pour contrôler ce juge. Critère fixé par la direction : zéro erreur de montant et 95 % de réponses jugées correctes. La première version atteint 88 %. Trois itérations sur les documents sources et les consignes sont nécessaires avant le lancement. Le même jeu de tests est rejoué à chaque mise à jour du modèle.

Comparaison

Trois méthodes de notation pour évaluer un assistant IA
Vérification automatiqueRelecture humaineLLM as a judge
PrincipeComparer à une réponse attendue (montant, catégorie, format)Un expert métier note chaque réponseUn second modèle note selon une grille
CoûtTrès faibleÉlevéFaible
VitesseImmédiateLenteRapide, à grande échelle
Adapté àChiffres, classifications, extractionsCas sensibles, calibrage initialClarté, ton, pertinence, complétude
LimiteInutilisable sur les réponses ouvertesPeu de cas couvertsBiais de position, de verbosité, d'auto-complaisance

Questions fréquentes

C'est quoi une eval en IA ?

Une eval est un test structuré : on soumet à un modèle ou à un assistant IA une série de cas représentatifs, puis on compare ses réponses à des critères définis à l'avance (réponse attendue, règle métier, grille de qualité). C'est l'équivalent, pour l'IA, d'une recette logicielle.

Qu'est-ce que le LLM as a judge ?

C'est une méthode où un modèle de langage note les réponses d'un autre modèle selon une grille (exactitude, clarté, ton). Elle permet d'évaluer des milliers de réponses rapidement. Zheng et al. (2023) ont montré qu'un juge comme GPT-4 rejoint les préférences humaines dans plus de 80 % des cas.

Quels sont les biais du LLM as a judge ?

Trois biais documentés : le biais de position (le juge favorise la réponse présentée en premier), le biais de verbosité (il préfère la réponse la plus longue) et l'auto-complaisance (il favorise les réponses de son propre modèle). Parades : alterner l'ordre, utiliser un juge d'un autre fournisseur, vérifier un échantillon à la main.

Quelle est la différence entre un benchmark et une évaluation métier ?

Un benchmark est un test public et standardisé (mathématiques, code, culture générale) qui compare les modèles entre eux. Une évaluation métier mesure la qualité sur vos propres cas, avec vos critères. Un modèle bien classé peut échouer sur vos documents, votre vocabulaire ou vos règles.

Combien de cas de test faut-il pour évaluer un assistant IA ?

Il n'existe pas de chiffre officiel. Anthropic recommande de privilégier le volume avec une notation automatisée plutôt que quelques cas notés à la main. En pratique, quelques centaines de cas réels, avec une part de cas pièges, donnent déjà une mesure exploitable pour décider d'une mise en production.

L'évaluation d'un assistant IA est-elle obligatoire ?

Pas de façon générale. Pour les systèmes à haut risque, l'AI Act impose un niveau approprié d'exactitude et de robustesse, à démontrer ; depuis l'Omnibus numérique IA (règlement 2026/1744), ces obligations s'appliquent au 2 décembre 2027 pour l'annexe III. Pour les autres usages, c'est une question de maîtrise du risque et de preuve en cas d'incident.

À voir aussi

Pour aller plus loin

Define success criteria and build evaluations, documentation Claude, Anthropic (ressource externe)

Sources

  1. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, Zheng et al., NeurIPS 2023, arXiv. https://arxiv.org/abs/2306.05685 (consulté le 2026-09-30)
  2. Create strong empirical evaluations (critères de succès, méthodes de notation), documentation Claude, Anthropic. https://platform.claude.com/docs/en/test-and-evaluate/develop-tests (consulté le 2026-09-30)
  3. Expanding on what we missed with sycophancy, OpenAI, 2 mai 2025. https://openai.com/index/expanding-on-sycophancy/ (consulté le 2026-09-30)
  4. Règlement (UE) 2026/1744 (Omnibus numérique IA), EUR-Lex. https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX%3A32026R1744 (consulté le 2026-09-30)

← Retour au glossaire

Adresse copiée