Jie Zhou
Déterminer si l'on peut faire confiance aux modèles de langage pour évaluer d'autres modèles de langage dans des pipelines NLP de production.
L'étude préliminaire de 2023 "Is ChatGPT a Good NLG Evaluator?", avec Zhou comme auteur senior, a été l'un des premiers articles à poser sérieusement la question que le domaine traitait comme acquise — un seul LLM à source fermée peut-il servir d'oracle de notation (scoring) d'une ligne de recherche entière, et que se passe-t-il quand on vérifie vraiment ? Les résultats étaient mitigés : ChatGPT utilisé comme juge corrélait bien avec les humains sur certaines tâches de NLG et mal sur d'autres, avec des biais qui n'apparaissaient qu'une fois les résultats stratifiés par type de tâche. Le travail plus large de Zhou porte sur l'IA conversationnelle industrielle, ce qui donne un angle particulier à la question : quand votre produit de dialogue parle à des centaines de millions d'utilisateurs, « l'évaluateur a globalement raison » n'est pas une réponse tolérable pour les cas où il ne l'a pas.