Xing Xie
Связывает традицию рекомендательных систем, где измеряют поведение пользовательского AI, с новыми вызовами оценки, которые ставят современные LLM.
Публикационная карьера Xie проходила через несколько смежных областей — рекомендательные системы, майнинг пространственных данных, инфраструктуру ответственного AI, — которым всем приходилось отвечать на один и тот же операционный вопрос: что эта AI-система реально делает для пользователя и как измерять это относительно реальных интересов пользователя, а не относительно benchmark, который вы сами задали. Его соавторство в "Survey on Evaluation of LLMs" (2023) читается как встреча этой долгой траектории с моментом LLM: многие методологические рамки для измерения справедливости, дрейфа или непреднамеренных пользовательских эффектов в рекомендательных системах переносятся на языковые модели напрямую, часто без модификаций. Для ai100, который оценивает, как языковые модели формируют то, что пользователи слышат о брендах, это ближайшая литература-предшественник — методология оценки рекомендательных систем, применённая к новому субстрату.