Предварительное исследование 2023 года "Is ChatGPT a Good NLG Evaluator?", где Zhou был старшим автором, одним из первых всерьёз поставило вопрос, который область уже начала считать решённым: может ли одна закрытая LLM быть скоринговым оракулом для целой исследовательской линии — и что происходит, когда это действительно проверяют? Результаты оказались смешанными: ChatGPT как судья хорошо коррелировал с людьми на одних NLG-задачах и плохо на других, а смещения не проявлялись, пока результаты не стратифицировали по типам задач. Более широкая работа Zhou лежит в индустриальном диалоговом AI, и это задаёт особый угол зрения: когда ваш диалоговый продукт разговаривает с сотнями миллионов пользователей, ответ «оценщик в основном прав» неприемлем для тех случаев, где он неправ.

Стоит читать, когда
вам нужен ранний и методологически осторожный разбор LLM как судьи, написанный человеком, которому приходится принимать решения об оценивании в production.
Темы
ранние эмпирические исследования надёжности LLM как судьи; смещения оценщика, стратифицированные по типам задач; оценка индустриального диалогового AI.
Ключевые работы
"Is ChatGPT a Good NLG Evaluator? A Preliminary Study" (2023, старший автор); продолжающиеся публикации о крупномасштабных диалоговых системах.