ARC, который Khot помог спроектировать в AI2, — benchmark по естествознанию школьного уровня, который нынешние статьи о LLM цитируют как свидетельство «способности к рассуждению»: вопросы, где модель должна понять, какой сценарий объясняет наблюдение, то есть сделать шаг за пределы поверхностного извлечения факта. Тот же инстинкт лежит в основе его работы Decomposed Prompting (2023, ведущий автор): если сложную задачу можно разбить на стабильный набор подзадач, можно задавать prompt для каждой подзадачи отдельно и затем собирать результаты обратно, получая одновременно более высокую точность и проверяемую трассу того, что сделала модель. Вместе эти две линии делают ARC более сильным инструментом оценки: можно точно увидеть, где именно в цепочке рассуждений модель потеряла вопрос.

Стоит читать, когда
вы хотите рассматривать дизайн benchmark-ов и методологию prompting как одну и ту же проблему в оценке LLM.
Темы
benchmark-и рассуждения (ARC и последующие); decomposed prompting и переиспользуемые паттерны подзадач; проверка трасс рассуждения как часть оценки.
Ключевые работы
AI2 Reasoning Challenge / ARC (2018, соавтор); Decomposed Prompting (2023, ведущий автор); текущие публикации AI2 по оценке машинного рассуждения.