Xing Xie
Die Verbindung zwischen der Tradition der Recommender-Systeme, nutzerseitiges KI-Verhalten zu messen, und den neuen Bewertungsproblemen, die moderne LLMs aufwerfen.
Xies veröffentlichte Laufbahn verläuft durch mehrere benachbarte Felder — Recommender-Systeme, räumliches Data Mining, Responsible-AI-Infrastruktur —, die alle dieselbe operative Frage beantworten mussten: Was tut dieses KI-System tatsächlich für den Nutzer, und wie misst man das an den wirklichen Interessen des Nutzers statt an einem benchmark, den man selbst definiert hat? Seine Mitautorenschaft an dem 2023 erschienenen „Survey on Evaluation of LLMs“ liest sich wie die Begegnung dieser langen Laufbahn mit dem LLM-Moment: Viele der methodischen Rahmen zur Messung von Fairness, Drift oder unbeabsichtigten nutzerseitigen Effekten in Recommender-Systemen lassen sich direkt auf Sprachmodelle übertragen, oft nahezu unverändert. Für ai100, das evaluiert, wie Sprachmodelle prägen, was Nutzer über Marken hören, ist dies die nächstliegende Vorläuferliteratur — Bewertungsmethodik für Recommender-Systeme, angewandt auf ein neues Substrat.