Xing Xie
Relier la tradition des systèmes de recommandation, qui mesure le comportement de l'IA face aux utilisateurs, aux nouveaux défis d'évaluation que posent les LLM modernes.
La carrière publiée de Xie a traversé plusieurs domaines adjacents — systèmes de recommandation, fouille de données spatiales, infrastructure d'IA responsable — qui ont tous dû répondre à la même question opérationnelle : que fait réellement ce système d'IA pour l'utilisateur, et comment le mesurer par rapport aux intérêts effectifs de cet utilisateur plutôt que par rapport à un benchmark que vous avez défini vous-même. Sa co-signature de "Survey on Evaluation of LLMs" en 2023 se lit comme la rencontre de cette longue carrière avec le moment LLM : nombre des cadres méthodologiques utilisés pour mesurer l'équité, la dérive ou les effets inattendus sur les utilisateurs dans les systèmes de recommandation se transfèrent directement aux modèles de langage, souvent sans modification. Pour ai100, qui évalue la manière dont les modèles de langage façonnent ce que les utilisateurs entendent à propos des marques, c'est la littérature précédente la plus proche — la méthodologie d'évaluation des systèmes de recommandation appliquée à un nouveau substrat.