Über weite Teile der NLP- und IR-Geschichte ließ sich Uneinigkeit nicht entscheiden, wenn zwei Paper unterschiedliche Zahlen auf dem „gleichen“ Benchmark berichteten — andere Splits, andere Prompts, anderer Code, andere Maschinen. Steins Webis-Gruppe baute TIRA, eine Plattform, die eingereichten Code in einer kontrollierten Umgebung ausführt, sodass „ich habe deinen Code auf diesen Daten ausgeführt“ zu einer buchstäblich ausführbaren Behauptung wird. Dasselbe Infrastrukturdenken treibt die PAN-Evaluationskampagnen an, die er seit 2009 mitgeleitet hat: Jede Aufgabe enthält ihr Evaluationsprotokoll als verbindlichen Teil der Aufgabendefinition.

Lesenswert, wenn
man Evaluationsinfrastruktur will, die Uneinigkeiten mit technischen Auflösungswegen produziert, nicht nur Uneinigkeiten, über die man publizieren kann.
Themen
reproduzierbare Evaluationsinfrastruktur (TIRA); langfristiges Shared-Task-Design (PAN); der Unterschied zwischen Evaluationskonventionen und erzwingbaren Evaluationsprotokollen.
Zentrale Arbeiten
TIRA Integrated Research Architecture (2007, laufend); PAN Shared-Task-Reihe (seit 2009, laufend, Mitvorsitzender); Publikationen der Webis-Gruppe zu Retrieval und Computational Argumentation.