Xies veröffentlichte Laufbahn verläuft durch mehrere benachbarte Felder — Recommender-Systeme, räumliches Data Mining, Responsible-AI-Infrastruktur —, die alle dieselbe operative Frage beantworten mussten: Was tut dieses KI-System tatsächlich für den Nutzer, und wie misst man das an den wirklichen Interessen des Nutzers statt an einem benchmark, den man selbst definiert hat? Seine Mitautorenschaft an dem 2023 erschienenen „Survey on Evaluation of LLMs“ liest sich wie die Begegnung dieser langen Laufbahn mit dem LLM-Moment: Viele der methodischen Rahmen zur Messung von Fairness, Drift oder unbeabsichtigten nutzerseitigen Effekten in Recommender-Systemen lassen sich direkt auf Sprachmodelle übertragen, oft nahezu unverändert. Für ai100, das evaluiert, wie Sprachmodelle prägen, was Nutzer über Marken hören, ist dies die nächstliegende Vorläuferliteratur — Bewertungsmethodik für Recommender-Systeme, angewandt auf ein neues Substrat.

Lesenswert, wenn
man LLM-Bewertungsmethodik will, die vom längeren Bogen der Evaluation nutzerseitiger KI-Systeme vor der Existenz von LLMs geprägt ist.
Themen
auf LLMs angewandte Bewertungsmethodik aus Recommender-Systemen; Responsible-AI-Infrastruktur in großen Forschungslabors; die Brücke zwischen Metriken für Recommender-Systeme und LLM-Evaluation.
Zentrale Arbeiten
Mitautor von „A Survey on Evaluation of LLMs“ (2023, mit Wang und Mitwirkenden); langjähriges Werk zu Recommender-Systemen und Urban Computing bei Microsoft Research Asia; laufende Responsible-AI-Publikationen.