← Zurück zur Liste
Jindong Wang
Zu standardisieren, was „ein LLM evaluieren“ als Forschungsprozedur überhaupt bedeutet.
Die Literatur zur LLM-Evaluation wuchs schneller als die Methodik, die diese Paper vergleichbar machen würde — unterschiedliche prompts, unterschiedliches Scoring, unterschiedliche Definitionen von „Erfolg“ erzeugten widersprüchliche Behauptungen über dieselben Modelle. Wang leitete die meistzitierte Synthese dieser Landschaft („Survey on Evaluation of LLMs“ von 2023, mit Koautoren) und baute PromptBench, ein offenes Framework für Stresstests der Modellrobustheit über prompt-Variationen hinweg — genau den Teil des Feldes, in dem die Lücke zwischen „das Modell funktioniert“ und „das Modell funktioniert mit exakt den Wörtern, die wir getestet haben“ liegt.