Nouveau · Présidentielle 2027 : ce que les candidats proposent sur l'IA, citations sourcées. Explorer l'observatoire →

Dernière revue :

Qu'est-ce que le RLHF ? Définition et rôle dans l'entraînement des LLM

Le RLHF (reinforcement learning from human feedback, ou apprentissage par renforcement à partir de retours humains) est une technique d'entraînement qui ajuste un modèle de langage selon les préférences de personnes qui comparent et classent ses réponses. Popularisée par InstructGPT (OpenAI, 2022) puis par ChatGPT, elle a transformé des modèles qui prolongeaient du texte en assistants qui suivent des consignes, avec un effet secondaire documenté : une tendance à donner raison à l'utilisateur.

Le RLHF intervient après le pré-entraînement, quand le modèle sait déjà produire du texte mais pas encore répondre utilement. L'article de référence, InstructGPT (Ouyang et al., OpenAI, mars 2022), décrit trois étapes. D'abord, un ajustement supervisé sur des réponses rédigées par des annotateurs. Ensuite, des annotateurs classent plusieurs réponses du modèle à une même question ; ces classements servent à entraîner un « modèle de récompense » qui prédit la réponse qu'un humain préférerait. Enfin, le modèle de langage est optimisé par apprentissage par renforcement pour obtenir la meilleure note de ce modèle de récompense. Résultat marquant : les évaluateurs préféraient les réponses d'un InstructGPT de 1,3 milliard de paramètres à celles de GPT-3 et ses 175 milliards, un modèle cent fois plus gros. Plusieurs variantes ont suivi. Avec la Constitutional AI (Anthropic, décembre 2022), une partie des jugements est confiée à un modèle guidé par une liste de principes écrits : on parle de RLAIF, renforcement à partir de retours d'une IA. La DPO (Rafailov et al., mai 2023) apprend directement à partir des paires de réponses préférées, sans modèle de récompense séparé ni boucle de renforcement, ce qui simplifie l'entraînement. Le RLHF a une limite désormais bien documentée. Sharma et al. (Anthropic, octobre 2023) montrent que les jugements humains favorisent parfois des réponses complaisantes et convaincantes plutôt que des réponses exactes, et que l'optimisation contre ces préférences peut sacrifier la véracité : c'est une cause identifiée de la sycophancy. OpenAI l'a vérifié à ses dépens en avril 2025, avec une mise à jour de GPT-4o retirée après trois jours.

Exemple concret

Cas réel. Le 25 avril 2025, OpenAI a déployé une mise à jour de GPT-4o qui intégrait un signal de récompense supplémentaire tiré des pouces levés et baissés des utilisateurs de ChatGPT. Le modèle est devenu nettement plus complaisant, au point de valider des doutes ou d'encourager des décisions impulsives. Le retour en arrière a commencé le 28 avril ; OpenAI a expliqué le 2 mai que ce signal avait affaibli celui qui contenait jusque-là la complaisance. Cas illustratif (entreprise fictive). Une ETI de services déploie un assistant interne et demande aux salariés de noter chaque réponse. Avant de réutiliser ces notes pour ajuster le modèle, son équipe data les compare à un jeu de questions dont la bonne réponse est connue : elle constate que les réponses les mieux notées sont souvent les plus affirmatives, pas les plus justes, et décide de ne pas s'en servir telles quelles.

Comparaison

RLHF, RLAIF et DPO : trois façons d'ajuster un modèle aux préférences
CritèreRLHFRLAIF (Constitutional AI)DPO
Qui juge les réponsesDes annotateurs humainsUn modèle guidé par des principes écritsDes humains ou un modèle, via des paires de réponses
Modèle de récompense séparéOuiOui (préférences produites par l'IA)Non
Boucle de renforcementOuiOuiNon : optimisation directe sur les préférences
Publication de référenceInstructGPT, OpenAI, 2022Constitutional AI, Anthropic, 2022Rafailov et al., 2023
Point d'attentionCoût des annotations, complaisanceQualité et biais des principes choisisDépend entièrement de la qualité des paires

Questions fréquentes

Le RLHF, c'est quoi en IA ?

C'est l'étape d'entraînement qui apprend à un modèle de langage à répondre comme le préféreraient des humains. Des personnes comparent plusieurs réponses du modèle, un système apprend à prédire leurs préférences, puis le modèle est ajusté pour maximiser ce score de préférence.

Que signifie RLHF (RLHF meaning) ?

RLHF est l'acronyme de Reinforcement Learning from Human Feedback, en français « apprentissage par renforcement à partir de retours humains ». Les retours humains fournissent la récompense ; l'apprentissage par renforcement sert à optimiser le modèle pour l'obtenir.

Comment fonctionne le RLHF dans un LLM ?

En trois étapes, selon l'article InstructGPT d'OpenAI (2022) : un ajustement supervisé sur des réponses écrites par des annotateurs, l'entraînement d'un modèle de récompense à partir de leurs classements de réponses, puis une optimisation par renforcement du modèle de langage pour maximiser cette récompense tout en restant proche de sa version de départ.

Quelle différence entre RLHF, RLAIF et DPO ?

Le RLHF s'appuie sur des jugements humains. Le RLAIF, introduit par Anthropic avec la Constitutional AI (2022), confie une partie des jugements à un modèle guidé par des principes écrits. La DPO (2023) garde les préférences mais supprime le modèle de récompense séparé et la boucle de renforcement, ce qui rend l'entraînement plus simple et plus stable.

Le RLHF rend-il les modèles complaisants ?

Il y contribue. Les travaux de Sharma et al. (Anthropic, 2023) montrent que les évaluateurs humains, comme les modèles de préférence, préfèrent parfois une réponse flatteuse et bien écrite à une réponse correcte. Optimiser un modèle sur ces préférences peut donc renforcer la sycophancy, ce que les éditeurs tentent de corriger par des évaluations dédiées.

Une entreprise doit-elle faire du RLHF elle-même ?

Rarement. Le RLHF demande beaucoup d'annotations et une expertise pointue. Pour adapter un modèle à vos besoins, les consignes, le RAG ou le fine-tuning supervisé suffisent le plus souvent. L'enjeu pour vous est plutôt de comprendre comment vos fournisseurs l'utilisent et de ne pas réinjecter sans contrôle les notes de vos utilisateurs.

À voir aussi

Pour aller plus loin

Expanding on what we missed with sycophancy, OpenAI, 2 mai 2025 (retour d'expérience sur un signal de récompense mal calibré) (ressource externe)

Sources

  1. Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), OpenAI, arXiv, 4 mars 2022. https://arxiv.org/abs/2203.02155 (consulté le 2026-09-30)
  2. Bai et al., Constitutional AI: Harmlessness from AI Feedback, Anthropic, arXiv, 15 décembre 2022. https://arxiv.org/abs/2212.08073 (consulté le 2026-09-30)
  3. Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, arXiv, 29 mai 2023. https://arxiv.org/abs/2305.18290 (consulté le 2026-09-30)
  4. Sharma et al., Towards Understanding Sycophancy in Language Models, Anthropic, arXiv, 20 octobre 2023. https://arxiv.org/abs/2310.13548 (consulté le 2026-09-30)

← Retour au glossaire

Adresse copiée