L'étude préliminaire de 2023 "Is ChatGPT a Good NLG Evaluator?", avec Zhou comme auteur senior, a été l'un des premiers articles à poser sérieusement la question que le domaine traitait comme acquise — un seul LLM à source fermée peut-il servir d'oracle de notation (scoring) d'une ligne de recherche entière, et que se passe-t-il quand on vérifie vraiment ? Les résultats étaient mitigés : ChatGPT utilisé comme juge corrélait bien avec les humains sur certaines tâches de NLG et mal sur d'autres, avec des biais qui n'apparaissaient qu'une fois les résultats stratifiés par type de tâche. Le travail plus large de Zhou porte sur l'IA conversationnelle industrielle, ce qui donne un angle particulier à la question : quand votre produit de dialogue parle à des centaines de millions d'utilisateurs, « l'évaluateur a globalement raison » n'est pas une réponse tolérable pour les cas où il ne l'a pas.

À lire lorsque
vous voulez un traitement précoce et méthodologiquement prudent du LLM-juge, écrit par quelqu'un qui doit faire compter les décisions de notation (scoring) en production.
Thèmes
premières études empiriques de la fiabilité du LLM-juge; biais d'évaluateur stratifiés par tâche; évaluation industrielle de l'IA conversationnelle.
Travaux clés
"Is ChatGPT a Good NLG Evaluator? A Preliminary Study" (2023, auteur senior); publications en cours sur les systèmes conversationnels à grande échelle.