Zhiting Hu
Рассматривать языковую модель как один компонент более крупной системы планирования — вместо того чтобы просить её выполнять рассуждение end-to-end у себя «в голове».
Доминирующая рамка для рассуждений LLM состоит в том, чтобы держать всё внутри языковой модели: дать ей prompt на вывод шагов рассуждения, сэмплировать из получившегося распределения и надеяться, что правильный ответ выпадет. RAP (Reasoning as Planning, 2023, где Hu был старшим автором) делает другую ставку: использовать LLM как модель мира, которая предсказывает, что произойдёт после кандидатного действия, и соединить её с классическим Monte Carlo Tree Search, чтобы выбрать действие. Архитектурное следствие в том, что рассуждение становится аудируемым так, как чистый prompting не позволяет: можно посмотреть на дерево поиска, увидеть, какие состояния модель сочла перспективными, и проследить, почему был выбран финальный ответ.