Группа Baroni построила SCAN (2018) как контролируемый тест композиционного обобщения: маленький синтетический язык, где модель должна комбинировать глаголы и модификаторы в паттернах, отсутствующих в обучении. Нейронные sequence-to-sequence модели, даже будучи тогда доминирующей архитектурой, провалились эффектно: они обобщали на одну короткую отложенную комбинацию, но ломались на чуть более длинных. Результат оказался более общим: последующие статьи показали те же провалы композиционного обобщения у современных LLM в масштабе. Это значит, что вопрос, который Baroni поставил на стол в 2018 году, одним только масштабом не снят.

Стоит читать, когда
вам нужно оценить, является ли рассуждение модели действительно композиционным или лишь изощрённой формой сопоставления с паттернами внутри распределения.
Темы
benchmark для композиционного обобщения (SCAN и последователи); дистрибутивная семантика с лингвистической стороны; что масштаб LLM исправляет и чего не исправляет в фундаментальных разрывах обобщения.
Ключевые работы
SCAN compositional-generalization benchmark (2018, старший автор); большая линия работ по дистрибутивной семантике из UPF Barcelona; публикации, отмеченные ACL test-of-time awards.