Norbert Fuhr
Was die Evaluation im Information Retrieval seit mehreren Jahrzehnten nachweislich falsch macht — und warum jede neue Forschergeneration dieselben Fehler wiederholt.
Fuhrs Paper von 2017 „Some Common Mistakes In IR Evaluation, And How They Can Be Avoided“ liest sich wie eine Checkliste, an der jedes LLM-Evaluations-Paper der letzten drei Jahre hätte begutachtet werden sollen. Die Liste umfasst Dinge wie das Berichten über Läufe gemittelter Metriken ohne Signifikanztests, den Vergleich von Systemen auf unterschiedlichen Testsammlungen oder den Einsatz statistischer Tests, die für die Daten ungeeignet sind — Fehler, die das IR-Feld bereits benannt hatte und die die Literatur zur Sprachmodell-Evaluation von Grund auf neu erfand. Sein längerer Werkkomplex, zurückreichend bis zum probabilistischen IR der späten 1980er, ist die lange Geschichte des Versuchs, Retrieval zu einer Disziplin zu machen und nicht zu Ingenieursfolklore.