Статья Fuhr 2017 года "Some Common Mistakes In IR Evaluation, And How They Can Be Avoided" читается как чек-лист, по которому следовало бы рецензировать каждую статью по оценке LLM за последние три года. В списке есть, например, публикация метрик, усреднённых по нескольким запускам, без проверки статистической значимости; сравнение систем на разных тестовых коллекциях; применение статистических тестов, не подходящих к данным, — ошибки, которые область IR уже назвала, а литература по оценке языковых моделей затем переизобрела с нуля. Его более длинный корпус работ, идущий от вероятностного IR конца 1980-х, — это большая история попытки сделать поиск дисциплиной, а не инженерным фольклором.

Стоит читать, когда
вы подозреваете, что свежая статья по оценке LLM допускает ошибки, которые сообщество IR задокументировало уже два десятилетия назад, — и вам нужна ссылка, которая это подтверждает.
Темы
основы вероятностного IR; методологические ошибки в оценке IR и NLP; длинная историческая дуга информационного поиска как дисциплины.
Ключевые работы
"Some Common Mistakes In IR Evaluation, And How They Can Be Avoided" (2017); основополагающие работы по вероятностному IR (с 1989 года); лекция Gerard Salton Award и тексты.