← Назад к списку
Tatsunori Hashimoto
Являются ли числа, которые сообщают о языковых моделях, статистическими результатами или методологическими артефактами.
Группа Hashimoto ведёт тихую, но настойчивую линию исследования: когда benchmark выдаёт результат, какая часть этого результата принадлежит модели, а какая — экспериментальной постановке? Его benchmark 2023 года для суммаризации новостей показал, что LLM, объявленные «почти человеческими» на стандартных датасетах, обязаны этим не меньше хрупким конвенциям оценивания этих датасетов, чем качеству моделей. Та же скептическая установка ведёт его более раннюю работу по устойчивости к сдвигам распределения: модель, которая хорошо работает на отложенной тестовой выборке, могла выучить уклон этой выборки, а не саму задачу.