El estudio preliminar de 2023 "Is ChatGPT a Good NLG Evaluator?", con Zhou como autor sénior, fue uno de los primeros artículos en plantear en serio la pregunta que el campo había estado tratando como una conclusión inevitable: ¿puede un único LLM de código cerrado ser el oráculo de puntuación para toda una línea de investigación, y qué ocurre cuando se comprueba de verdad? Los resultados fueron mixtos: ChatGPT como juez correlacionaba bien con los humanos en algunas tareas de NLG y mal en otras, con sesgos que no aparecían hasta estratificar por tipo de tarea. El trabajo más amplio de Zhou está en la IA conversacional industrial, lo que da un ángulo particular a la pregunta: cuando un producto de diálogo habla con cientos de millones de usuarios, «el evaluador acierta casi siempre» no es una respuesta tolerable para los casos en que no acierta.

Vale la pena seguirlo cuando
se quiere un tratamiento temprano, metodológicamente prudente, del LLM como juez, escrito por alguien que tiene que hacer que las decisiones de puntuación cuenten en producción.
Temas
estudios empíricos tempranos sobre la fiabilidad del LLM como juez; sesgo del evaluador estratificado por tarea; evaluación de IA conversacional industrial.
Obras clave
"Is ChatGPT a Good NLG Evaluator? A Preliminary Study" (2023, autor sénior); publicaciones en curso sobre sistemas conversacionales a gran escala.