Choi — самый последовательный голос в NLP, доказывающий, что масштаб сам по себе не создаёт рассуждение здравого смысла; её группа построила benchmark-и, которые это показывают: HellaSwag (где люди отвечают правильно в 95% случаев, а языковые модели 2019 года — в 47%), PIQA для физического здравого смысла, SIQA для социального, COMET для графов знаний здравого смысла. Рамка, которую она привнесла в область, — что текущая оценка засчитывает моделям сопоставление поверхностных паттернов на задачах, где люди используют настоящие модели мира, — хорошо выдержала время: более крупные LLM улучшили результаты на benchmark-ах, но продолжают производить ошибки рассуждения, для выявления которых эти benchmark-и и создавались. Для ai100 это литература, которая обосновывает скепсис к заголовочным benchmark-числам: модель, набирающая 92% на benchmark-ах здравого смысла, всё ещё может делать не то, что делают люди, набирая 95%, и эта разница важна для последующего поведения.

Стоит читать, когда
вам нужна методология оценки LLM, основанная на разрыве между benchmark-показателями и реальной компетентностью в рассуждении, — от исследовательницы, которая высказывала этот аргумент ещё до того, как он стал модным.
Темы
оценка рассуждения здравого смысла (HellaSwag, PIQA, SIQA, COMET); методологический разрыв между benchmark-баллами и компетентностью рассуждения; длинная линия работ о том, что на самом деле измеряет оценка NLP.
Ключевые работы
HellaSwag (2019, старший автор); PIQA: Reasoning about Physical Commonsense (2020, соавтор); COMET: Commonsense Transformers for Automatic Knowledge Graph Construction (2019, старший автор); Defending Against Neural Fake News (Grover, 2019, старший автор); корпус работ AI2 Mosaic Team по commonsense AI.