L'article de Fuhr de 2017, "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided", se lit comme une liste de vérification à laquelle chaque article d'évaluation des LLM des trois dernières années aurait dû être confronté. La liste inclut des pratiques comme le fait de rapporter des métriques moyennées sur plusieurs exécutions sans test de significativité, de comparer des systèmes sur des collections de test différentes, ou d'appliquer des tests statistiques inadaptés aux données — des défaillances que le domaine de la recherche d'information avait déjà nommées et que la littérature sur l'évaluation des modèles de langage a réinventées à partir de zéro. Son œuvre plus longue, qui remonte à la recherche d'information probabiliste de la fin des années 1980, raconte au long cours la tentative de faire de la recherche d'information une discipline plutôt qu'un folklore d'ingénierie.

À lire lorsque
vous soupçonnez qu'un article actuel sur l'évaluation des LLM commet des erreurs que la communauté de la recherche d'information avait déjà documentées il y a vingt ans — et vous voulez une citation pour l'étayer.
Thèmes
fondements de la recherche d'information probabiliste; erreurs méthodologiques en évaluation de la recherche d'information et du NLP; histoire au long cours de la recherche d'information comme discipline.
Travaux clés
"Some Common Mistakes In IR Evaluation, And How They Can Be Avoided" (2017); travaux fondateurs sur la recherche d'information probabiliste (1989 et après); conférence et écrits liés au Gerard Salton Award.