Tatsunori Hashimoto
Ob die über Sprachmodelle berichteten Zahlen statistische Befunde oder methodische Artefakte sind.
Hashimotos Gruppe verfolgt eine leise, beharrliche Forschungslinie: Wenn ein benchmark ein Ergebnis erzeugt, welcher Teil dieses Ergebnisses ist das Modell und welcher Teil ist der Versuchsaufbau? Sein 2023er benchmark zur Nachrichtenzusammenfassung zeigte, dass LLMs, die auf Standarddatensätzen als „nahe am Menschen“ ausgewiesen wurden, diesen Befund ebenso sehr den brüchigen Scoring-Konventionen dieser Datensätze verdankten wie der Modellqualität. Dieselbe Skepsis treibt seine frühere Arbeit zu Verteilungsrobustheit an — ein Modell, das auf einem zurückgehaltenen Testsatz gut abschneidet, kann die Schieflage des Testsatzes gelernt haben statt die zugrunde liegende Aufgabe.