Norbert Fuhr
Что в оценке информационного поиска десятилетиями делалось неправильно — в опубликованном виде — и почему каждое новое поколение исследователей повторяет те же ошибки.
Статья Fuhr 2017 года "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided" читается как чек-лист, по которому следовало бы рецензировать каждую статью по оценке LLM за последние три года. В списке есть, например, публикация метрик, усреднённых по нескольким запускам, без проверки статистической значимости; сравнение систем на разных тестовых коллекциях; применение статистических тестов, не подходящих к данным, — ошибки, которые область IR уже назвала, а литература по оценке языковых моделей затем переизобрела с нуля. Его более длинный корпус работ, идущий от вероятностного IR конца 1980-х, — это большая история попытки сделать поиск дисциплиной, а не инженерным фольклором.