Última revisión:
¿Qué es el aprendizaje por refuerzo? Definición, ejemplos y papel en la IA generativa
El aprendizaje por refuerzo es un método de aprendizaje automático en el que un sistema aprende qué acciones elegir probándolas y recibiendo una recompensa o una penalización, para maximizar una ganancia acumulada en el tiempo. Asociado durante mucho tiempo a los juegos y la robótica, sirve también para ajustar el comportamiento de los asistentes conversacionales (RLHF) y para entrenar los modelos de razonamiento.
La CNIL, autoridad francesa de protección de datos, lo define como un proceso de aprendizaje automático que consiste, para un sistema autónomo, en aprender las acciones que debe realizar, a partir de experiencias, para optimizar una recompensa cuantitativa a lo largo del tiempo. No hay ejemplos corregidos, como en el aprendizaje supervisado, ni simple exploración de datos, como en el no supervisado: un «agente» actúa en un entorno, observa el resultado, recibe una señal de recompensa y ajusta su estrategia. Andrew Barto y Richard Sutton sentaron sus bases conceptuales y algorítmicas a partir de los años ochenta, lo que les valió el premio Turing 2024, anunciado por la ACM el 5 de marzo de 2025. El gran público lo descubrió con AlphaGo: el programa de DeepMind, entrenado primero con partidas de expertos y después jugando miles de veces contra sí mismo, venció al campeón Lee Sedol por 4 a 1 en marzo de 2016 en Seúl. Desde entonces, el aprendizaje por refuerzo ha entrado en la IA generativa por dos puertas. La primera es el RLHF, que ajusta un modelo de lenguaje según las preferencias de evaluadores humanos; la ACM recuerda que ChatGPT se entrenó en dos fases, la segunda de las cuales recurre a esta técnica. La segunda es el entrenamiento de los modelos de razonamiento: DeepSeek mostró en enero de 2025, en un artículo publicado después en Nature, que las capacidades de razonamiento de un modelo de lenguaje pueden desarrollarse mediante refuerzo puro, sin ejemplos de razonamiento anotados por humanos, con una recompensa basada en respuestas verificables. La ACM cita también usos industriales: cadenas de suministro, diseño de chips, publicidad en línea, congestión de redes. Su principal límite: el sistema optimiza exactamente la recompensa que se le da, no la intención de quien la definió.
Ejemplo concreto
Caso ilustrativo (empresa ficticia). Una cadena francesa de 25 tiendas de bricolaje quiere mejorar su reposición. En lugar de prever la demanda producto a producto, su proveedor entrena un agente por refuerzo en un simulador construido con dos años de ventas: en cada ciclo, el agente decide las cantidades que se deben pedir y recibe una recompensa que combina la facturación obtenida, las roturas de stock evitadas y el coste del inventario. Tras la fase de simulación, las propuestas del agente se comparan durante tres meses con las de los compradores en algunas tiendas piloto, que conservan la validación. Para la mayoría de las pymes, sin embargo, el refuerzo sigue siendo indirecto: ya está presente en los asistentes de IA que utilizan, ajustados mediante RLHF, y en los modelos de razonamiento.
Comparación
| Criterio | Refuerzo clásico | RLHF | Refuerzo con recompensas verificables |
|---|---|---|---|
| Origen de la recompensa | El entorno: puntuación de un juego, coste, plazo | Un modelo entrenado con preferencias humanas | Un control automático: respuesta correcta, código que supera las pruebas |
| Ejemplo | AlphaGo (2016), robótica, logística | InstructGPT (2022), ChatGPT | DeepSeek-R1 (2025), modelos de razonamiento |
| Lo que se optimiza | Una estrategia de acción | El estilo y la utilidad percibida de las respuestas | La exactitud en problemas con solución verificable |
| Riesgo principal | Atajos imprevistos para maximizar la puntuación | Complacencia con el usuario | Rendimiento limitado a ámbitos verificables |
Preguntas frecuentes
¿Qué es el aprendizaje por refuerzo en palabras sencillas?
Es aprender por ensayo y error, guiado por una recompensa. El sistema prueba una acción, comprueba si el resultado es bueno o malo según una puntuación definida de antemano y ajusta su estrategia para obtener una puntuación mejor la vez siguiente. Se parece a la forma de adiestrar a un animal con premios.
¿Cuál es un ejemplo de aprendizaje por refuerzo?
El ejemplo más conocido es AlphaGo, de DeepMind, que progresó jugando miles de veces contra sí mismo y después venció al campeón Lee Sedol en marzo de 2016. Otros ejemplos: robots que aprenden movimientos en simulación, optimización logística, publicidad en línea y el ajuste de asistentes como ChatGPT mediante RLHF.
¿Qué diferencia hay con el aprendizaje supervisado y no supervisado?
El supervisado aprende a partir de ejemplos cuya respuesta correcta se proporciona. El no supervisado busca estructuras en datos sin respuesta. El refuerzo no tiene una respuesta hecha: solo recibe una señal (recompensa o penalización) tras cada acción, y debe descubrir por sí mismo la mejor estrategia a largo plazo.
¿Qué relación tiene con ChatGPT y los modelos de razonamiento?
Hay dos vínculos directos. El RLHF, una forma de aprendizaje por refuerzo guiada por preferencias humanas, sirvió para que los modelos de lenguaje fueran útiles y siguieran las instrucciones. Y los modelos de razonamiento, como DeepSeek-R1 (enero de 2025), se entrenan por refuerzo con problemas cuya respuesta es verificable, lo que los lleva a producir un razonamiento más largo antes de responder.
¿Quién inventó el aprendizaje por refuerzo?
La idea de aprender mediante recompensas es antigua; Alan Turing ya la mencionaba en 1950. Andrew Barto y Richard Sutton formalizaron su marco y sus principales algoritmos a partir de los años ochenta, y publicaron en 1998 el manual de referencia del campo. Por ello recibieron el premio Turing 2024, anunciado el 5 de marzo de 2025.
¿Dónde encontrar un curso sobre aprendizaje por refuerzo?
El manual de Sutton y Barto, Reinforcement Learning: An Introduction (2.ª edición, 2018), puede consultarse libremente en línea y sigue siendo la referencia. Requiere una base matemática. Para un directivo, entender el trío agente, entorno y recompensa basta para evaluar un proyecto.
Ver también
Para profundizar
Fuentes
- Apprentissage par renforcement (aprendizaje por refuerzo), definición, CNIL (autoridad francesa de protección de datos). https://www.cnil.fr/fr/definition/apprentissage-par-renforcement
- ACM A.M. Turing Award Honors Two Researchers Who Led the Development of Cornerstone AI Technology, comunicado de la ACM, 5 de marzo de 2025. https://www.acm.org/media-center/2025/march/turing-award-2024
- AlphaGo, página de presentación, Google DeepMind. https://deepmind.google/research/alphago/
- DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, arXiv, 22 de enero de 2025 (publicado en Nature, vol. 645, 2025). https://arxiv.org/abs/2501.12948