Ashish Sabharwal
Что классические исследования формального рассуждения могут дать оценке того, действительно ли современные LLM рассуждают, — и как отличить это от языка, похожего на рассуждение, который просто случайно приводит к правильному ответу.
Sabharwal пришёл к исследованиям LLM из формального рассуждения и задач выполнимости (SAT) — областей, где фраза «система рассуждает правильно» имеет точный смысл, измеряется относительно логических спецификаций и проверяется операциональными тестами. Этот бэкграунд читается в его более поздних работах по оценке рассуждения LLM: склонность смотреть не только на то, оказался ли итоговый ответ правильным, но и на то, соответствует ли структура рассуждения структуре, которую требует задача. ARC и похожие benchmark-и — результат этой установки: они спроектированы так, чтобы поверхностная беглость не заменяла настоящего вывода.