Jie Zhou
Si se puede confiar en que los modelos de lenguaje evalúen otros modelos de lenguaje en pipelines NLP de producción.
El estudio preliminar de 2023 "Is ChatGPT a Good NLG Evaluator?", con Zhou como autor sénior, fue uno de los primeros artículos en plantear en serio la pregunta que el campo había estado tratando como una conclusión inevitable: ¿puede un único LLM de código cerrado ser el oráculo de puntuación para toda una línea de investigación, y qué ocurre cuando se comprueba de verdad? Los resultados fueron mixtos: ChatGPT como juez correlacionaba bien con los humanos en algunas tareas de NLG y mal en otras, con sesgos que no aparecían hasta estratificar por tipo de tarea. El trabajo más amplio de Zhou está en la IA conversacional industrial, lo que da un ángulo particular a la pregunta: cuando un producto de diálogo habla con cientos de millones de usuarios, «el evaluador acierta casi siempre» no es una respuesta tolerable para los casos en que no acierta.