Martin Potthast
Si los modelos de lenguaje pueden usarse para juzgar si un documento es relevante para una consulta — y qué cambia cuando sustituyen a evaluadores humanos en ese rol.
Durante décadas, los juicios de relevancia —las etiquetas que dicen «este documento es relevante para esta consulta»— fueron producidos por evaluadores humanos, caros y lentos, pero el patrón oro para la evaluación de IR. La línea de trabajo "LLMs for Relevance" de Potthast, ejecutada junto con la red Webis, planteó la pregunta práctica: ¿cuánto puede acercarse un modelo de lenguaje a los juicios de relevancia de expertos humanos, y dónde se rompe silenciosamente la sustitución? Los hallazgos son mixtos de una forma productiva: lo bastante cercanos en algunos tipos de tarea como para permitir evaluación a escalas de corpus que la evaluación humana no puede alcanzar, y lo bastante desviados en otros como para que cualquier uso acrítico produzca benchmarks sistemáticamente sesgados.