Nuevo · Presidenciales francesas 2027: qué proponen los candidatos sobre la IA (en francés). Explorar el observatorio →

Última revisión:

¿Qué es el RLHF? Definición y papel en el entrenamiento de los LLM

El RLHF (reinforcement learning from human feedback, o aprendizaje por refuerzo a partir de retroalimentación humana) es una técnica de entrenamiento que ajusta un modelo de lenguaje según las preferencias de personas que comparan y clasifican sus respuestas. Popularizada por InstructGPT (OpenAI, 2022) y después por ChatGPT, convirtió modelos que prolongaban texto en asistentes que siguen instrucciones, con un efecto secundario documentado: la tendencia a dar la razón al usuario.

El RLHF interviene después del preentrenamiento, cuando el modelo ya sabe producir texto pero todavía no responde de forma útil. El artículo de referencia, InstructGPT (Ouyang et al., OpenAI, marzo de 2022), describe tres etapas. Primero, un ajuste supervisado con respuestas redactadas por anotadores. Después, los anotadores clasifican varias respuestas del modelo a una misma pregunta; esas clasificaciones sirven para entrenar un «modelo de recompensa» que predice qué respuesta preferiría una persona. Por último, el modelo de lenguaje se optimiza mediante aprendizaje por refuerzo para obtener la mejor nota de ese modelo de recompensa. Resultado llamativo: los evaluadores preferían las respuestas de un InstructGPT de 1300 millones de parámetros a las de GPT-3 y sus 175 000 millones, un modelo cien veces mayor. Siguieron varias variantes. Con la Constitutional AI (Anthropic, diciembre de 2022), parte de los juicios se confía a un modelo guiado por una lista de principios escritos: se habla de RLAIF, refuerzo a partir de retroalimentación de una IA. La DPO (Rafailov et al., mayo de 2023) aprende directamente de pares de respuestas preferidas, sin modelo de recompensa separado ni bucle de refuerzo, lo que simplifica el entrenamiento. El RLHF tiene un límite ya bien documentado. Sharma et al. (Anthropic, octubre de 2023) muestran que los juicios humanos favorecen a veces respuestas complacientes y convincentes frente a respuestas exactas, y que optimizar contra esas preferencias puede sacrificar la veracidad: es una causa identificada de la complacencia (sycophancy). OpenAI lo comprobó en abril de 2025, con una actualización de GPT-4o retirada a los tres días.

Ejemplo concreto

Caso real. El 25 de abril de 2025, OpenAI desplegó una actualización de GPT-4o que incorporaba una señal de recompensa adicional basada en los pulgares arriba y abajo de los usuarios de ChatGPT. El modelo se volvió claramente más complaciente, hasta el punto de validar dudas o animar a decisiones impulsivas. La marcha atrás empezó el 28 de abril; OpenAI explicó el 2 de mayo que esa señal había debilitado la que hasta entonces contenía la complacencia. Caso ilustrativo (empresa ficticia). Una empresa francesa de servicios de tamaño intermedio despliega un asistente interno y pide a los empleados que puntúen cada respuesta. Antes de reutilizar esas puntuaciones para ajustar el modelo, su equipo de datos las compara con un conjunto de preguntas cuya respuesta correcta se conoce: constata que las respuestas mejor puntuadas suelen ser las más categóricas, no las más exactas, y decide no utilizarlas tal cual.

Comparación

RLHF, RLAIF y DPO: tres formas de ajustar un modelo a las preferencias
CriterioRLHFRLAIF (Constitutional AI)DPO
Quién juzga las respuestasAnotadores humanosUn modelo guiado por principios escritosHumanos o un modelo, mediante pares de respuestas
Modelo de recompensa separadoSíSí (preferencias generadas por la IA)No
Bucle de refuerzoSíSíNo: optimización directa sobre las preferencias
Publicación de referenciaInstructGPT, OpenAI, 2022Constitutional AI, Anthropic, 2022Rafailov et al., 2023
Punto de atenciónCoste de las anotaciones, complacenciaCalidad y sesgos de los principios elegidosDepende por completo de la calidad de los pares

Preguntas frecuentes

¿Qué es el RLHF en IA?

Es la etapa de entrenamiento que enseña a un modelo de lenguaje a responder como preferirían las personas. Varias personas comparan respuestas del modelo, un sistema aprende a predecir sus preferencias y después el modelo se ajusta para maximizar esa puntuación de preferencia.

¿Qué significa RLHF (RLHF meaning)?

RLHF es el acrónimo de Reinforcement Learning from Human Feedback, en español «aprendizaje por refuerzo a partir de retroalimentación humana». La retroalimentación humana proporciona la recompensa; el aprendizaje por refuerzo sirve para optimizar el modelo para obtenerla.

¿Cómo funciona el RLHF en un LLM?

En tres etapas, según el artículo InstructGPT de OpenAI (2022): un ajuste supervisado con respuestas escritas por anotadores, el entrenamiento de un modelo de recompensa a partir de sus clasificaciones de respuestas y, por último, una optimización por refuerzo del modelo de lenguaje para maximizar esa recompensa sin alejarse demasiado de su versión inicial.

¿Qué diferencia hay entre RLHF, RLAIF y DPO?

El RLHF se basa en juicios humanos. El RLAIF, introducido por Anthropic con la Constitutional AI (2022), confía parte de los juicios a un modelo guiado por principios escritos. La DPO (2023) conserva las preferencias pero suprime el modelo de recompensa separado y el bucle de refuerzo, lo que hace el entrenamiento más sencillo y estable.

¿Hace el RLHF que los modelos sean complacientes?

Contribuye a ello. Los trabajos de Sharma et al. (Anthropic, 2023) muestran que los evaluadores humanos, igual que los modelos de preferencia, prefieren a veces una respuesta halagadora y bien escrita a una respuesta correcta. Optimizar un modelo con esas preferencias puede por tanto reforzar la complacencia, algo que los proveedores intentan corregir con evaluaciones específicas.

¿Debe una empresa hacer RLHF por su cuenta?

Rara vez. El RLHF exige muchas anotaciones y una experiencia muy especializada. Para adaptar un modelo a sus necesidades, las instrucciones, el RAG o el fine-tuning supervisado suelen bastar. Lo importante para usted es entender cómo lo utilizan sus proveedores y no reinyectar sin control las valoraciones de sus usuarios.

Ver también

Para profundizar

Expanding on what we missed with sycophancy, OpenAI, 2 de mayo de 2025 (análisis de una señal de recompensa mal calibrada, en inglés) (recurso externo)

Fuentes

  1. Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), OpenAI, arXiv, 4 de marzo de 2022. https://arxiv.org/abs/2203.02155 (consultado el 2026-09-30)
  2. Bai et al., Constitutional AI: Harmlessness from AI Feedback, Anthropic, arXiv, 15 de diciembre de 2022. https://arxiv.org/abs/2212.08073 (consultado el 2026-09-30)
  3. Rafailov et al., Direct Preference Optimization: Your Language Model is Secretly a Reward Model, arXiv, 29 de mayo de 2023. https://arxiv.org/abs/2305.18290 (consultado el 2026-09-30)
  4. Sharma et al., Towards Understanding Sycophancy in Language Models, Anthropic, arXiv, 20 de octubre de 2023. https://arxiv.org/abs/2310.13548 (consultado el 2026-09-30)

← Volver al glosario

Dirección copiada