El artículo de Fuhr de 2017, "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided", se lee como una lista de verificación contra la que debería haberse revisado todo artículo de evaluación de LLM de los últimos tres años. La lista incluye cosas como reportar métricas promediadas sobre ejecuciones sin pruebas de significancia, comparar sistemas en colecciones de prueba distintas, aplicar pruebas estadísticas inapropiadas para los datos: fallos que el campo de IR ya había nombrado y que la literatura de evaluación de modelos de lenguaje reinventó desde cero. Su trayectoria más larga, que se remonta a la IR probabilística de finales de los años ochenta, es la larga historia de intentar convertir la recuperación en una disciplina y no en folklore de ingeniería.

Vale la pena seguirlo cuando
se sospecha que un artículo actual de evaluación de LLM está cometiendo errores que la comunidad de IR ya documentó hace dos décadas, y se quiere una cita que lo respalde.
Temas
fundamentos de la IR probabilística; errores metodológicos en evaluación de IR y NLP; historia de largo arco de la recuperación de información como disciplina.
Obras clave
"Some Common Mistakes In IR Evaluation, And How They Can Be Avoided" (2017); trabajo fundacional en IR probabilística (1989 en adelante); conferencia y escritos del Gerard Salton Award.