Yejin Choi
Что потребовалось бы, чтобы у языковой модели появилось то, чего у людей с избытком и чего LLM стабильно не хватает, — здравый смысл.
Choi — самый последовательный голос в NLP, доказывающий, что масштаб сам по себе не создаёт рассуждение здравого смысла; её группа построила benchmark-и, которые это показывают: HellaSwag (где люди отвечают правильно в 95% случаев, а языковые модели 2019 года — в 47%), PIQA для физического здравого смысла, SIQA для социального, COMET для графов знаний здравого смысла. Рамка, которую она привнесла в область, — что текущая оценка засчитывает моделям сопоставление поверхностных паттернов на задачах, где люди используют настоящие модели мира, — хорошо выдержала время: более крупные LLM улучшили результаты на benchmark-ах, но продолжают производить ошибки рассуждения, для выявления которых эти benchmark-и и создавались. Для ai100 это литература, которая обосновывает скепсис к заголовочным benchmark-числам: модель, набирающая 92% на benchmark-ах здравого смысла, всё ещё может делать не то, что делают люди, набирая 95%, и эта разница важна для последующего поведения.