Über Jahrzehnte wurden Relevanzurteile — die Labels, die sagen „dieses Dokument ist für diese Anfrage relevant“ — von menschlichen Assessoren erstellt, teuer und langsam, aber der Goldstandard für IR-Evaluation. Potthasts Forschungslinie „LLMs for Relevance“, gemeinsam mit dem Webis-Netzwerk betrieben, stellte die praktische Frage: Wie nahe kommt ein Sprachmodell an fachkundige menschliche Relevanzurteile heran, und wo bricht diese Ersetzung stillschweigend? Die Befunde sind auf produktive Weise gemischt — nah genug für einige Aufgabentypen, um Evaluation in Korpusgrößen zu ermöglichen, die menschliche Bewertung nicht erreicht, und in anderen Fällen weit genug entfernt, dass jede unkritische Nutzung systematisch verzerrte benchmarks erzeugt.

Lesenswert, wenn
man wissen will, ob der Einsatz eines LLMs zur Bewertung von Relevanz für die eigene Evaluation angemessen ist — und wo nicht.
Themen
LLMs als Ersatz für menschliche Relevanzassessoren; großskalige IR-Evaluation unter Labeling-Beschränkungen; europäische offene Web-Suchinfrastruktur (OpenWebSearch.eu).
Zentrale Arbeiten
Webis-Forschungslinie „LLMs for Relevance“ (seit 2023); langjährige PAN- und TIRA-Beiträge (mit Stein); OpenWebSearch.eu-Veröffentlichungen zu offener Infrastruktur.