Durante la mayor parte de la historia de NLP e IR, cuando dos artículos informaban cifras diferentes en el «mismo» benchmark, el desacuerdo no podía resolverse: particiones distintas, prompts distintos, código distinto, máquinas distintas. El grupo Webis de Stein construyó TIRA, una plataforma que ejecuta el código enviado en un entorno controlado para que «ejecuté tu código sobre estos datos» se convierta en una afirmación literalmente ejecutable. El mismo pensamiento de infraestructura impulsa las campañas de evaluación PAN que ha codirigido desde 2009: cada tarea incluye su protocolo de evaluación como parte vinculante de la definición de la tarea.

Vale la pena seguirlo cuando
se quiere infraestructura de evaluación que produzca desacuerdos con vías técnicas de resolución, no solo desacuerdos sobre los que se pueda publicar.
Temas
infraestructura de evaluación reproducible (TIRA); diseño de tareas compartidas de larga duración (PAN); diferencia entre convenciones de evaluación y protocolos de evaluación exigibles.
Obras clave
TIRA Integrated Research Architecture (2007, en curso); serie de tareas compartidas PAN (2009, en curso, codirector); publicaciones del grupo Webis sobre recuperación y argumentación computacional.