Norbert Fuhr
Lo que la evaluación de recuperación de información lleva décadas haciendo mal —documentado por escrito— y por qué cada nueva generación de investigadores comete los mismos errores.
El artículo de Fuhr de 2017, "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided", se lee como una lista de verificación contra la que debería haberse revisado todo artículo de evaluación de LLM de los últimos tres años. La lista incluye cosas como reportar métricas promediadas sobre ejecuciones sin pruebas de significancia, comparar sistemas en colecciones de prueba distintas, aplicar pruebas estadísticas inapropiadas para los datos: fallos que el campo de IR ya había nombrado y que la literatura de evaluación de modelos de lenguaje reinventó desde cero. Su trayectoria más larga, que se remonta a la IR probabilística de finales de los años ochenta, es la larga historia de intentar convertir la recuperación en una disciplina y no en folklore de ingeniería.