Публикационная карьера Xie проходила через несколько смежных областей — рекомендательные системы, майнинг пространственных данных, инфраструктуру ответственного AI, — которым всем приходилось отвечать на один и тот же операционный вопрос: что эта AI-система реально делает для пользователя и как измерять это относительно реальных интересов пользователя, а не относительно benchmark, который вы сами задали. Его соавторство в "Survey on Evaluation of LLMs" (2023) читается как встреча этой долгой траектории с моментом LLM: многие методологические рамки для измерения справедливости, дрейфа или непреднамеренных пользовательских эффектов в рекомендательных системах переносятся на языковые модели напрямую, часто без модификаций. Для ai100, который оценивает, как языковые модели формируют то, что пользователи слышат о брендах, это ближайшая литература-предшественник — методология оценки рекомендательных систем, применённая к новому субстрату.

Стоит читать, когда
вам нужна методология оценки LLM, сформированная более длинной историей оценки пользовательских AI-систем до появления LLM.
Темы
методология оценки рекомендательных систем, применённая к LLM; инфраструктура ответственного AI внутри крупных исследовательских лабораторий; мост между метриками рекомендательных систем и оценкой LLM.
Ключевые работы
соавторство в "A Survey on Evaluation of LLMs" (2023, с Wang и коллегами); большая линия работ по рекомендательным системам и urban computing в Microsoft Research Asia; продолжающиеся публикации по ответственному AI.