Zhiting Hu
Tratar un modelo de lenguaje como un componente dentro de un sistema de planificación más amplio, en lugar de pedirle que haga razonamiento de extremo a extremo dentro de su propia cabeza.
El marco dominante para el razonamiento en LLM consiste en mantenerlo todo dentro del modelo de lenguaje: inducirlo con un prompt para que produzca pasos de razonamiento, muestrear de la distribución resultante y esperar que aparezca la respuesta correcta. RAP (Reasoning as Planning, 2023, con Hu como autora sénior) apuesta por otra cosa: usar el LLM como modelo del mundo que predice qué ocurre después de una acción candidata, y combinarlo con la búsqueda clásica Monte Carlo Tree Search para elegir qué acción tomar realmente. La consecuencia arquitectónica es que el razonamiento se vuelve auditable de un modo que el prompting puro no permite: se puede inspeccionar el árbol de búsqueda, ver qué estados evaluó el modelo como prometedores y rastrear por qué se eligió la respuesta final.