Fuhrs Paper von 2017 „Some Common Mistakes In IR Evaluation, And How They Can Be Avoided“ liest sich wie eine Checkliste, an der jedes LLM-Evaluations-Paper der letzten drei Jahre hätte begutachtet werden sollen. Die Liste umfasst Dinge wie das Berichten über Läufe gemittelter Metriken ohne Signifikanztests, den Vergleich von Systemen auf unterschiedlichen Testsammlungen oder den Einsatz statistischer Tests, die für die Daten ungeeignet sind — Fehler, die das IR-Feld bereits benannt hatte und die die Literatur zur Sprachmodell-Evaluation von Grund auf neu erfand. Sein längerer Werkkomplex, zurückreichend bis zum probabilistischen IR der späten 1980er, ist die lange Geschichte des Versuchs, Retrieval zu einer Disziplin zu machen und nicht zu Ingenieursfolklore.

Lesenswert, wenn
man vermutet, dass ein aktuelles LLM-Evaluationspaper Fehler macht, die die IR-Community schon vor zwei Jahrzehnten dokumentiert hat — und dafür eine zitierfähige Quelle braucht.
Themen
Grundlagen probabilistischer IR; methodische Fehler in IR- und NLP-Evaluation; die langfristige Geschichte des Information Retrieval als Disziplin.
Zentrale Arbeiten
„Some Common Mistakes In IR Evaluation, And How They Can Be Avoided“ (2017); grundlegende Arbeiten zum probabilistischen IR (seit 1989); Gerard-Salton-Award-Vortrag und Schriften.