Tushar Khot
Что «способность к рассуждению» означает как объект, который можно поместить в benchmark, — и что меняется, когда вы также пытаетесь направлять модель к рассуждению через структурированный prompting.
ARC, который Khot помог спроектировать в AI2, — benchmark по естествознанию школьного уровня, который нынешние статьи о LLM цитируют как свидетельство «способности к рассуждению»: вопросы, где модель должна понять, какой сценарий объясняет наблюдение, то есть сделать шаг за пределы поверхностного извлечения факта. Тот же инстинкт лежит в основе его работы Decomposed Prompting (2023, ведущий автор): если сложную задачу можно разбить на стабильный набор подзадач, можно задавать prompt для каждой подзадачи отдельно и затем собирать результаты обратно, получая одновременно более высокую точность и проверяемую трассу того, что сделала модель. Вместе эти две линии делают ARC более сильным инструментом оценки: можно точно увидеть, где именно в цепочке рассуждений модель потеряла вопрос.