Группа Hashimoto ведёт тихую, но настойчивую линию исследования: когда benchmark выдаёт результат, какая часть этого результата принадлежит модели, а какая — экспериментальной постановке? Его benchmark 2023 года для суммаризации новостей показал, что LLM, объявленные «почти человеческими» на стандартных датасетах, обязаны этим не меньше хрупким конвенциям оценивания этих датасетов, чем качеству моделей. Та же скептическая установка ведёт его более раннюю работу по устойчивости к сдвигам распределения: модель, которая хорошо работает на отложенной тестовой выборке, могла выучить уклон этой выборки, а не саму задачу.

Стоит читать, когда
вы хотите читать статью об оценке и понимать, стоит ли верить заглавному числу.
Темы
статистическая оценка языковых моделей; валидность benchmark и загрязнение; устойчивость обученных моделей к сдвигам распределения.
Ключевые работы
Benchmarking LLMs for News Summarization (2023); фундаментальная работа по устойчивости к сдвигам распределения и group DRO (2019, продолжается).