Доминирующая рамка для рассуждений LLM состоит в том, чтобы держать всё внутри языковой модели: дать ей prompt на вывод шагов рассуждения, сэмплировать из получившегося распределения и надеяться, что правильный ответ выпадет. RAP (Reasoning as Planning, 2023, где Hu был старшим автором) делает другую ставку: использовать LLM как модель мира, которая предсказывает, что произойдёт после кандидатного действия, и соединить её с классическим Monte Carlo Tree Search, чтобы выбрать действие. Архитектурное следствие в том, что рассуждение становится аудируемым так, как чистый prompting не позволяет: можно посмотреть на дерево поиска, увидеть, какие состояния модель сочла перспективными, и проследить, почему был выбран финальный ответ.

Стоит читать, когда
вы хотите понять, как меняется поведение LLM в рассуждении, когда модель ограничена явной поисковой структурой, а не свободно импровизирует в тексте, порождённом prompt.
Темы
языковые модели как модели мира для планирования; интеграция классического поиска (MCTS) с компонентами LLM; аудируемые трассы рассуждений в агентных системах.
Ключевые работы
RAP — Reasoning with Language Model is Planning (2023, старший автор); более широкий корпус публикаций о совмещении символьных и нейронных методов для структурированной генерации.