Pendant des décennies, les jugements de pertinence — les étiquettes qui disent « ce document est pertinent pour cette requête » — ont été produits par des évaluateurs humains, coûteux et lents, mais considérés comme l'étalon-or de l'évaluation en IR. La ligne de travaux "LLMs for Relevance" de Potthast, menée conjointement avec le réseau Webis, a posé la question pratique : jusqu'où un modèle de langage peut-il se rapprocher des jugements de pertinence d'experts humains, et où la substitution se brise-t-elle silencieusement ? Les résultats sont mitigés d'une manière productive — assez proches pour certains types de tâches afin de permettre une évaluation à des échelles de corpus impossibles pour l'annotation humaine, mais assez éloignés dans d'autres pour que tout usage non critique produise des benchmarks systématiquement biaisés.

À lire lorsque
vous voulez savoir si l'utilisation d'un LLM pour noter la pertinence convient à votre évaluation, et où elle ne convient pas.
Thèmes
LLM comme substituts des évaluateurs humains de pertinence; évaluation IR à grande échelle sous contraintes d'annotation; infrastructure européenne de recherche Web ouverte (OpenWebSearch.eu).
Travaux clés
ligne Webis "LLMs for Relevance" (depuis 2023); contributions de longue date à PAN et TIRA (avec Stein); publications OpenWebSearch.eu sur l'infrastructure ouverte.