Última revisión:
¿Qué es la evaluación de LLM? Definición de las evals y del LLM as a judge
La evaluación de LLM (las «evals») consiste en medir la calidad de las respuestas de un modelo o de un asistente de IA sobre un conjunto de casos representativos, con criterios de éxito fijados de antemano. El LLM as a judge es uno de sus métodos: un segundo modelo puntúa las respuestas del primero, lo que permite evaluar a gran escala, a costa de sesgos conocidos.
Una clasificación pública (benchmark) dice poco sobre su caso de uso. Para decidir si un asistente de IA puede pasar a producción, hace falta una evaluación propia de su negocio. Se basa en tres elementos. Primero, criterios de éxito precisos y medibles: exactitud, tono, ausencia de datos personales, latencia, coste. Anthropic recomienda evitar objetivos vagos como «buen rendimiento». Segundo, un juego de pruebas que refleje la distribución real de las solicitudes, casos límite incluidos. Tercero, un método de puntuación: comparación automática con la respuesta esperada cuando es posible, revisión humana de una muestra, o puntuación por otro modelo. Este último método, el LLM as a judge, fue estudiado por Zheng et al. (2023): GPT-4 utilizado como juez coincide con las preferencias humanas en más del 80 % de los casos, el mismo nivel de acuerdo observado entre humanos. Los autores describen también tres sesgos: el sesgo de posición (preferir la respuesta presentada en primer lugar), el sesgo de verbosidad (preferir la más larga) y la autocomplacencia (preferir sus propias respuestas). De ahí la recomendación de Anthropic: usar para puntuar un modelo distinto del que genera. Las evals no terminan con el lanzamiento. Se repiten en cada cambio de modelo, de prompt o de datos. En abril de 2025, OpenAI tuvo que retirar una actualización de GPT-4o considerada demasiado complaciente: sus evals offline y sus pruebas A/B eran buenas, pero ninguna eval de despliegue medía la complacencia.
Ejemplo concreto
Caso ilustrativo: una mutua regional francesa prepara un asistente que responde a los afiliados sobre sus garantías. Antes del lanzamiento, el equipo reúne 400 preguntas reales del historial del servicio de atención, de las cuales 60 son casos trampa (garantías canceladas, preguntas médicas, solicitudes fuera de alcance). Dos gestores redactan la respuesta esperada para cada una. Las respuestas del asistente se puntúan de tres maneras: verificación automática de los importes de reembolso, puntuación de la claridad y el tono por un modelo de otro proveedor, revisión humana de un 10 % de casos al azar para controlar a ese juez. Criterio fijado por la dirección: cero errores de importe y 95 % de respuestas consideradas correctas. La primera versión alcanza el 88 %. Hacen falta tres iteraciones sobre los documentos fuente y las instrucciones antes del lanzamiento. El mismo juego de pruebas se repite en cada actualización del modelo.
Comparación
| Verificación automática | Revisión humana | LLM as a judge | |
|---|---|---|---|
| Principio | Comparar con una respuesta esperada (importe, categoría, formato) | Un experto de negocio puntúa cada respuesta | Un segundo modelo puntúa según una rúbrica |
| Coste | Muy bajo | Alto | Bajo |
| Velocidad | Inmediata | Lenta | Rápida, a gran escala |
| Adecuado para | Cifras, clasificaciones, extracciones | Casos sensibles, calibración inicial | Claridad, tono, pertinencia, exhaustividad |
| Límite | Inservible en respuestas abiertas | Pocos casos cubiertos | Sesgos de posición, verbosidad y autocomplacencia |
Preguntas frecuentes
¿Qué es una eval en IA?
Una eval es una prueba estructurada: se somete a un modelo o a un asistente de IA una serie de casos representativos y se comparan sus respuestas con criterios definidos de antemano (respuesta esperada, regla de negocio, rúbrica de calidad). Es el equivalente, para la IA, de una prueba de aceptación de software.
¿Qué es el LLM as a judge?
Es un método en el que un modelo de lenguaje puntúa las respuestas de otro modelo según una rúbrica (exactitud, claridad, tono). Permite evaluar miles de respuestas con rapidez. Zheng et al. (2023) mostraron que un juez como GPT-4 coincide con las preferencias humanas en más del 80 % de los casos.
¿Cuáles son los sesgos del LLM as a judge?
Tres sesgos documentados: el sesgo de posición (el juez favorece la respuesta presentada primero), el sesgo de verbosidad (prefiere la respuesta más larga) y la autocomplacencia (favorece las respuestas de su propio modelo). Remedios: alternar el orden, usar un juez de otro proveedor, verificar una muestra a mano.
¿Cuál es la diferencia entre un benchmark y una evaluación de negocio?
Un benchmark es una prueba pública y estandarizada (matemáticas, código, cultura general) que compara modelos entre sí. Una evaluación de negocio mide la calidad sobre sus propios casos, con sus criterios. Un modelo bien clasificado puede fallar con sus documentos, su vocabulario o sus reglas.
¿Cuántos casos de prueba hacen falta para evaluar un asistente de IA?
No existe una cifra oficial. Anthropic recomienda priorizar el volumen con puntuación automatizada frente a pocos casos puntuados a mano. En la práctica, unos cientos de casos reales, con una parte de casos trampa, ya ofrecen una medida útil para decidir una puesta en producción.
¿Es obligatoria la evaluación de un asistente de IA?
No de forma general. Para los sistemas de alto riesgo, el Reglamento de IA exige un nivel adecuado de exactitud y solidez, que debe demostrarse; desde el Ómnibus digital de IA (Reglamento 2026/1744), estas obligaciones se aplican a partir del 2 de diciembre de 2027 para el anexo III. Para los demás usos, es una cuestión de control del riesgo y de prueba en caso de incidente.
Ver también
Para profundizar
Define success criteria and build evaluations, documentación de Claude, Anthropic
Fuentes
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, Zheng et al., NeurIPS 2023, arXiv. https://arxiv.org/abs/2306.05685
- Create strong empirical evaluations (criterios de éxito, métodos de puntuación), documentación de Claude, Anthropic. https://platform.claude.com/docs/en/test-and-evaluate/develop-tests
- Expanding on what we missed with sycophancy, OpenAI, 2 de mayo de 2025. https://openai.com/index/expanding-on-sycophancy/
- Reglamento (UE) 2026/1744 (Ómnibus digital de IA), EUR-Lex. https://eur-lex.europa.eu/legal-content/EN/TXT/HTML/?uri=CELEX%3A32026R1744