Charles L. A. Clarke
Qué requiere una evaluación sistemática y replicable de sistemas de respuesta a preguntas ahora que los sistemas evaluados son modelos de lenguaje y no recuperadores.
Clarke pasó tres décadas dentro de la tradición de evaluación TREC, donde la comparación rigurosa de sistemas de recuperación implicaba corpus compartidos, consultas compartidas, juicios de relevancia compartidos y un protocolo explícito para resolver desacuerdos entre evaluadores. Su artículo de 2023 "Evaluating Open-Domain QA in the Era of LLMs" lleva esa disciplina al momento actual, señalando que la mayor parte de la evaluación de QA basada en LLM ha abandonado silenciosamente la mayoría de esas salvaguardas: verdad de referencia de fuente única, jueces automáticos no validados contra humanos, ausencia de protocolo para respuestas técnicamente correctas pero estilísticamente distintas de la referencia. El reinicio metodológico que propone está más cerca de la postura original de TREC que de cualquier cosa actualmente de moda.