Jie Zhou
Можно ли доверять языковым моделям оценивать другие языковые модели в production NLP-конвейерах.
Предварительное исследование 2023 года "Is ChatGPT a Good NLG Evaluator?", где Zhou был старшим автором, одним из первых всерьёз поставило вопрос, который область уже начала считать решённым: может ли одна закрытая LLM быть скоринговым оракулом для целой исследовательской линии — и что происходит, когда это действительно проверяют? Результаты оказались смешанными: ChatGPT как судья хорошо коррелировал с людьми на одних NLG-задачах и плохо на других, а смещения не проявлялись, пока результаты не стратифицировали по типам задач. Более широкая работа Zhou лежит в индустриальном диалоговом AI, и это задаёт особый угол зрения: когда ваш диалоговый продукт разговаривает с сотнями миллионов пользователей, ответ «оценщик в основном прав» неприемлем для тех случаев, где он неправ.