Norbert Fuhr
Ce que l'évaluation en recherche d'information fait mal, par écrit, depuis plusieurs décennies — et pourquoi chaque nouvelle génération de chercheurs refait les mêmes erreurs.
L'article de Fuhr de 2017, "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided", se lit comme une liste de vérification à laquelle chaque article d'évaluation des LLM des trois dernières années aurait dû être confronté. La liste inclut des pratiques comme le fait de rapporter des métriques moyennées sur plusieurs exécutions sans test de significativité, de comparer des systèmes sur des collections de test différentes, ou d'appliquer des tests statistiques inadaptés aux données — des défaillances que le domaine de la recherche d'information avait déjà nommées et que la littérature sur l'évaluation des modèles de langage a réinventées à partir de zéro. Son œuvre plus longue, qui remonte à la recherche d'information probabiliste de la fin des années 1980, raconte au long cours la tentative de faire de la recherche d'information une discipline plutôt qu'un folklore d'ingénierie.