Durante décadas, los juicios de relevancia —las etiquetas que dicen «este documento es relevante para esta consulta»— fueron producidos por evaluadores humanos, caros y lentos, pero el patrón oro para la evaluación de IR. La línea de trabajo "LLMs for Relevance" de Potthast, ejecutada junto con la red Webis, planteó la pregunta práctica: ¿cuánto puede acercarse un modelo de lenguaje a los juicios de relevancia de expertos humanos, y dónde se rompe silenciosamente la sustitución? Los hallazgos son mixtos de una forma productiva: lo bastante cercanos en algunos tipos de tarea como para permitir evaluación a escalas de corpus que la evaluación humana no puede alcanzar, y lo bastante desviados en otros como para que cualquier uso acrítico produzca benchmarks sistemáticamente sesgados.

Vale la pena seguirlo cuando
se quiere saber si usar un LLM para calificar relevancia es adecuado para la evaluación propia, y dónde no lo es.
Temas
LLM como sustitutos de evaluadores humanos de relevancia; evaluación de IR a gran escala bajo restricciones de etiquetado; infraestructura europea de búsqueda web abierta (OpenWebSearch.eu).
Obras clave
línea Webis "LLMs for Relevance" (2023 en adelante); contribuciones históricas a PAN y TIRA (con Stein); publicaciones de infraestructura abierta OpenWebSearch.eu.