Clarke a passé trois décennies dans la tradition d'évaluation TREC, où la comparaison rigoureuse de systèmes de recherche impliquait des corpus partagés, des requêtes partagées, des jugements de pertinence partagés et un protocole explicite pour résoudre les désaccords entre évaluateurs. Son article de 2023 "Evaluating Open-Domain QA in the Era of LLMs" porte cette discipline dans le moment actuel, en soulignant que la plupart des évaluations de question-réponse fondées sur des LLM ont discrètement abandonné la plupart de ces garde-fous — vérité terrain à source unique, des juges automatiques non validés par rapport à des humains, aucun protocole pour les réponses techniquement correctes mais stylistiquement différentes de la référence. La remise à plat méthodologique qu'il défend est plus proche de la posture TREC originelle que de tout ce qui est actuellement à la mode.

À lire lorsque
vous voulez savoir à quoi ressemblait une évaluation rigoureuse de la question-réponse avant que les LLM ne fassent oublier les règles à tout le monde, et lesquelles de ces règles devraient revenir.
Thèmes
méthodologie d'évaluation de type TREC; évaluation de la question-réponse à l'ère des réponses générées par LLM; désaccord entre évaluateurs et construction de la vérité terrain.
Travaux clés
Information Retrieval: Implementing and Evaluating Search Engines (manuel, 2010, avec Büttcher et Cormack); "Evaluating Open-Domain QA in the Era of LLMs" (2023, co-auteur); décennies d'organisation et de participation à TREC.