Clarke три десятилетия провёл внутри традиции оценки TREC, где строгие сравнения поисковых систем требовали общих корпусов, общих запросов, общих оценок релевантности и явного протокола разрешения расхождений между ассессорами. Его статья 2023 года "Evaluating Open-Domain QA in the Era of LLMs" переносит эту дисциплину в текущий момент, показывая, что большая часть оценки QA на базе LLM незаметно отбросила большинство этих страховочных механизмов: эталон из одного источника, автоматические судьи, не валидированные по человеческим оценкам, отсутствие протокола для ответов, которые технически верны, но стилистически отличаются от эталона. Методологический перезапуск, за который он выступает, ближе к исходной позиции TREC, чем почти ко всему, что сейчас в моде.

Стоит читать, когда
вы хотите понять, как выглядела строгая оценка QA до того, как LLM заставили всех забыть правила, и какие из этих правил стоит вернуть.
Темы
методология оценки в стиле TREC; оценка QA в эпоху ответов, сгенерированных LLM; расхождения между ассессорами и построение эталона.
Ключевые работы
Information Retrieval: Implementing and Evaluating Search Engines (учебник, 2010, с Büttcher и Cormack); "Evaluating Open-Domain QA in the Era of LLMs" (2023, соавтор); десятилетия организации TREC и участия в нём.