Hashimotos Gruppe verfolgt eine leise, beharrliche Forschungslinie: Wenn ein benchmark ein Ergebnis erzeugt, welcher Teil dieses Ergebnisses ist das Modell und welcher Teil ist der Versuchsaufbau? Sein 2023er benchmark zur Nachrichtenzusammenfassung zeigte, dass LLMs, die auf Standarddatensätzen als „nahe am Menschen“ ausgewiesen wurden, diesen Befund ebenso sehr den brüchigen Scoring-Konventionen dieser Datensätze verdankten wie der Modellqualität. Dieselbe Skepsis treibt seine frühere Arbeit zu Verteilungsrobustheit an — ein Modell, das auf einem zurückgehaltenen Testsatz gut abschneidet, kann die Schieflage des Testsatzes gelernt haben statt die zugrunde liegende Aufgabe.

Lesenswert, wenn
man ein Evaluationspaper liest und wissen will, ob man der Headline-Zahl glauben sollte.
Themen
statistische Evaluation von Sprachmodellen; Validität und Kontamination von benchmarks; Verteilungsrobustheit trainierter Modelle.
Zentrale Arbeiten
Benchmarking LLMs for News Summarization (2023); grundlegende Arbeiten zu Verteilungsrobustheit und group DRO (2019, laufend).