Charles L. A. Clarke
Что требуется для систематической, воспроизводимой оценки вопросно-ответных систем теперь, когда оцениваемые системы — языковые модели, а не ретриверы.
Clarke три десятилетия провёл внутри традиции оценки TREC, где строгие сравнения поисковых систем требовали общих корпусов, общих запросов, общих оценок релевантности и явного протокола разрешения расхождений между ассессорами. Его статья 2023 года "Evaluating Open-Domain QA in the Era of LLMs" переносит эту дисциплину в текущий момент, показывая, что большая часть оценки QA на базе LLM незаметно отбросила большинство этих страховочных механизмов: эталон из одного источника, автоматические судьи, не валидированные по человеческим оценкам, отсутствие протокола для ответов, которые технически верны, но стилистически отличаются от эталона. Методологический перезапуск, за который он выступает, ближе к исходной позиции TREC, чем почти ко всему, что сейчас в моде.