Sabharwal пришёл к исследованиям LLM из формального рассуждения и задач выполнимости (SAT) — областей, где фраза «система рассуждает правильно» имеет точный смысл, измеряется относительно логических спецификаций и проверяется операциональными тестами. Этот бэкграунд читается в его более поздних работах по оценке рассуждения LLM: склонность смотреть не только на то, оказался ли итоговый ответ правильным, но и на то, соответствует ли структура рассуждения структуре, которую требует задача. ARC и похожие benchmark-и — результат этой установки: они спроектированы так, чтобы поверхностная беглость не заменяла настоящего вывода.

Стоит читать, когда
вам нужна оценка рассуждения LLM, укоренённая в более старой традиции формального рассуждения, где «корректность» имела операциональный смысл ещё до прихода глубокого обучения.
Темы
формальное рассуждение и SAT-solving применительно к оценке LLM; проверка трасс рассуждения в QA benchmark-ах; мост между классическим AI-выводом и текущим поведением LLM.
Ключевые работы
AI2 Reasoning Challenge / ARC (2018, соавтор); работы до эпохи LLM по tractable inference и SAT; недавние публикации AI2 эпохи LLM по оценке рассуждения.