Charles L. A. Clarke
Ce qu'exige une évaluation systématique et réplicable des systèmes de question-réponse — maintenant que les systèmes évalués sont des modèles de langage plutôt que des modules de recherche (retriever).
Clarke a passé trois décennies dans la tradition d'évaluation TREC, où la comparaison rigoureuse de systèmes de recherche impliquait des corpus partagés, des requêtes partagées, des jugements de pertinence partagés et un protocole explicite pour résoudre les désaccords entre évaluateurs. Son article de 2023 "Evaluating Open-Domain QA in the Era of LLMs" porte cette discipline dans le moment actuel, en soulignant que la plupart des évaluations de question-réponse fondées sur des LLM ont discrètement abandonné la plupart de ces garde-fous — vérité terrain à source unique, des juges automatiques non validés par rapport à des humains, aucun protocole pour les réponses techniquement correctes mais stylistiquement différentes de la référence. La remise à plat méthodologique qu'il défend est plus proche de la posture TREC originelle que de tout ce qui est actuellement à la mode.