El artículo G-Eval de 2023 cristalizó una práctica que llevaba un año insinuándose en el campo: en lugar de escribir otra métrica automática para la calidad de NLG, usar un LLM fuerte como juez, darle un prompt con una rúbrica estructurada y leer su salida como una puntuación. G-Eval correlacionó con el juicio humano mejor que todas las métricas automáticas anteriores en las mismas tareas, y el artículo es ahora la referencia citable para casi cualquier sistema que puntúa texto generado con un modelo — incluido el de ai100, que depende de que este enfoque exista como metodología defendible y no como un truco ingenioso.

Vale la pena seguirlo cuando
se quiere entender el fundamento metodológico bajo «dejar que el modelo lo califique» y cómo defenderlo en un contexto revisado por pares.
Temas
LLM como juez en tanto metodología de puntuación; prompting con cadena de razonamiento en evaluación; alineación con juicios humanos de métricas automáticas de NLG.
Obras clave
G-Eval: NLG Evaluation Using GPT-4 with Better Human Alignment (2023, autor principal); refinamientos posteriores de la metodología LLM como juez.