La carrière publiée de Xie a traversé plusieurs domaines adjacents — systèmes de recommandation, fouille de données spatiales, infrastructure d'IA responsable — qui ont tous dû répondre à la même question opérationnelle : que fait réellement ce système d'IA pour l'utilisateur, et comment le mesurer par rapport aux intérêts effectifs de cet utilisateur plutôt que par rapport à un benchmark que vous avez défini vous-même. Sa co-signature de "Survey on Evaluation of LLMs" en 2023 se lit comme la rencontre de cette longue carrière avec le moment LLM : nombre des cadres méthodologiques utilisés pour mesurer l'équité, la dérive ou les effets inattendus sur les utilisateurs dans les systèmes de recommandation se transfèrent directement aux modèles de langage, souvent sans modification. Pour ai100, qui évalue la manière dont les modèles de langage façonnent ce que les utilisateurs entendent à propos des marques, c'est la littérature précédente la plus proche — la méthodologie d'évaluation des systèmes de recommandation appliquée à un nouveau substrat.

À lire lorsque
vous voulez une méthodologie d'évaluation des LLM informée par le long arc de l'évaluation des systèmes d'IA exposés aux utilisateurs avant l'existence des LLM.
Thèmes
méthodologie d'évaluation des systèmes de recommandation appliquée aux LLM; infrastructure d'IA responsable au sein de grands laboratoires de recherche; pont entre les métriques des systèmes de recommandation et l'évaluation des LLM.
Travaux clés
co-signature de "A Survey on Evaluation of LLMs" (2023, avec Wang et collaborateurs); travaux au long cours sur les systèmes de recommandation et l'informatique urbaine à Microsoft Research Asia; publications en cours sur l'IA responsable.