На протяжении большей части истории NLP и информационного поиска, когда две статьи сообщали разные числа на «одном и том же» benchmark, спор нельзя было закрыть: разные разбиения, разные prompt'ы, разный код, разные машины. Группа Stein Webis построила TIRA — платформу, которая запускает присланный код в контролируемой среде, так что фраза «я прогнал ваш код на этих данных» становится буквально исполняемым утверждением. Та же инфраструктурная логика лежит в основе оценочных кампаний PAN, которые он соорганизует с 2009 года: в каждой задаче протокол оценки является обязательной частью определения задачи.

Стоит читать, когда
вам нужна инфраструктура оценки, которая создаёт разногласия с техническими путями разрешения, а не просто разногласия, о которых можно публиковать статьи.
Темы
воспроизводимая инфраструктура оценки (TIRA); дизайн долгосрочных shared tasks (PAN); разница между оценочными конвенциями и исполнимыми протоколами оценки.
Ключевые работы
TIRA Integrated Research Architecture (2007, продолжается); серия shared-task PAN (с 2009 года, сопредседатель); публикации группы Webis по поиску и вычислительной аргументации.