Dernière revue :
Qu'est-ce que l'apprentissage par renforcement ? Définition, exemples et rôle dans l'IA générative
L'apprentissage par renforcement est une méthode d'apprentissage automatique dans laquelle un système apprend quelles actions choisir en les essayant et en recevant une récompense ou une pénalité, de façon à maximiser un gain cumulé dans le temps. Longtemps associé aux jeux et à la robotique, il sert aussi à ajuster le comportement des assistants conversationnels (RLHF) et à entraîner les modèles de raisonnement.
La CNIL le définit comme un procédé d'apprentissage automatique consistant, pour un système autonome, à apprendre les actions à réaliser, à partir d'expériences, de façon à optimiser une récompense quantitative au cours du temps. Il n'y a ni exemples corrigés, comme en apprentissage supervisé, ni simple exploration de données, comme en non supervisé : un « agent » agit dans un environnement, observe le résultat, reçoit un signal de récompense et ajuste sa stratégie. Andrew Barto et Richard Sutton en ont posé les fondements conceptuels et algorithmiques à partir des années 1980, ce qui leur a valu le prix Turing 2024, annoncé par l'ACM le 5 mars 2025. Le grand public l'a découvert avec AlphaGo : le programme de DeepMind, entraîné d'abord sur des parties d'experts puis en jouant contre lui-même des milliers de fois, a battu le champion Lee Sedol 4 victoires à 1 en mars 2016, à Séoul. Depuis, l'apprentissage par renforcement est entré dans l'IA générative par deux portes. La première est le RLHF, qui ajuste un modèle de langage selon les préférences d'évaluateurs humains ; l'ACM rappelle que ChatGPT a été entraîné en deux phases, dont la seconde recourt à cette technique. La seconde est l'entraînement des modèles de raisonnement : DeepSeek a montré en janvier 2025, dans un article publié ensuite dans Nature, que les capacités de raisonnement d'un modèle de langage peuvent être développées par renforcement pur, sans exemples de raisonnement annotés par des humains, la récompense venant de réponses vérifiables. L'ACM cite aussi des usages industriels : optimisation de chaînes logistiques, conception de puces, publicité en ligne, contrôle de congestion des réseaux. Sa principale limite : le système optimise exactement la récompense qu'on lui donne, pas l'intention de celui qui l'a définie.
Exemple concret
Cas illustratif (entreprise fictive). Une enseigne de 25 magasins de bricolage veut améliorer son réassort. Plutôt que de prédire la demande produit par produit, son prestataire entraîne un agent par renforcement dans un simulateur construit à partir de deux ans de ventes : à chaque cycle, l'agent décide des quantités à commander et reçoit une récompense qui combine chiffre d'affaires réalisé, ruptures évitées et coût du stock. Après la phase de simulation, les propositions de l'agent sont comparées pendant trois mois à celles des acheteurs sur quelques magasins pilotes, qui gardent la main sur la validation. Pour la plupart des PME, le renforcement reste toutefois indirect : il est déjà présent dans les assistants IA qu'elles utilisent, ajustés par RLHF, et dans les modèles de raisonnement.
Comparaison
| Critère | Renforcement classique | RLHF | Renforcement à récompenses vérifiables |
|---|---|---|---|
| Source de la récompense | L'environnement : score d'un jeu, coût, délai | Un modèle entraîné sur des préférences humaines | Un contrôle automatique : réponse juste, code qui passe les tests |
| Exemple | AlphaGo (2016), robotique, logistique | InstructGPT (2022), ChatGPT | DeepSeek-R1 (2025), modèles de raisonnement |
| Ce qui est optimisé | Une stratégie d'action | Le style et l'utilité perçue des réponses | L'exactitude sur des problèmes à solution vérifiable |
| Risque principal | Raccourcis imprévus pour maximiser le score | Complaisance envers l'utilisateur | Performance limitée aux domaines vérifiables |
Questions fréquentes
L'apprentissage par renforcement, c'est quoi en termes simples ?
C'est apprendre par essais et erreurs, guidé par une récompense. Le système tente une action, voit si le résultat est bon ou mauvais selon un score défini à l'avance, et ajuste sa stratégie pour obtenir un meilleur score la fois suivante. Il ressemble à la manière dont on dresse un animal avec des friandises.
Quel est un exemple d'apprentissage par renforcement ?
L'exemple le plus connu est AlphaGo, de DeepMind, qui a progressé en jouant contre lui-même des milliers de fois, puis a battu le champion Lee Sedol en mars 2016. Autres exemples : robots qui apprennent des gestes en simulation, optimisation logistique, publicité en ligne, et l'ajustement des assistants comme ChatGPT par RLHF.
Quelle différence avec l'apprentissage supervisé et non supervisé ?
Le supervisé apprend à partir d'exemples dont la bonne réponse est fournie. Le non supervisé cherche des structures dans des données sans réponse. Le renforcement n'a pas de réponse toute faite : il reçoit seulement un signal (récompense ou pénalité) après chaque action, et doit découvrir lui-même la meilleure stratégie sur la durée.
Quel rapport avec ChatGPT et les modèles de raisonnement ?
Deux liens directs. Le RLHF, une forme d'apprentissage par renforcement guidée par des préférences humaines, a servi à rendre les modèles de langage utiles et conformes aux consignes. Et les modèles de raisonnement, comme DeepSeek-R1 (janvier 2025), sont entraînés par renforcement sur des problèmes dont la réponse est vérifiable, ce qui les pousse à produire un raisonnement plus long avant de répondre.
Qui a inventé l'apprentissage par renforcement ?
L'idée d'apprendre par la récompense est ancienne ; Alan Turing l'évoquait dès 1950. Andrew Barto et Richard Sutton en ont formalisé le cadre et les algorithmes principaux à partir des années 1980, et publié en 1998 le manuel de référence du domaine. Ils ont reçu pour cela le prix Turing 2024, annoncé le 5 mars 2025.
Où trouver un cours sur l'apprentissage par renforcement ?
Le manuel de Sutton et Barto, Reinforcement Learning: An Introduction (2e édition, 2018), est librement consultable en ligne et reste la référence. Il suppose des bases en mathématiques. Pour un dirigeant, comprendre le triptyque agent, environnement, récompense suffit pour juger un projet.
À voir aussi
Pour aller plus loin
Sources
- Apprentissage par renforcement, définition, CNIL. https://www.cnil.fr/fr/definition/apprentissage-par-renforcement
- ACM A.M. Turing Award Honors Two Researchers Who Led the Development of Cornerstone AI Technology, communiqué ACM, 5 mars 2025. https://www.acm.org/media-center/2025/march/turing-award-2024
- AlphaGo, page de présentation, Google DeepMind. https://deepmind.google/research/alphago/
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, arXiv, 22 janvier 2025 (publié dans Nature, vol. 645, 2025). https://arxiv.org/abs/2501.12948