Zhiting Hu
Traiter un modèle de langage comme un composant d'un système de planification plus vaste — au lieu de lui demander de faire le raisonnement de bout en bout dans sa propre tête.
Le cadrage dominant du raisonnement des LLM consiste à tout garder à l'intérieur du modèle de langage : le pousser par prompt à produire des étapes de raisonnement, échantillonner dans la distribution obtenue, espérer que la bonne réponse en sorte. RAP (Reasoning as Planning, 2023, avec Hu comme auteur senior) parie autrement — utiliser le LLM comme modèle du monde qui prédit ce qui se passe après une action candidate, et le combiner avec une recherche classique de type Monte Carlo Tree Search pour choisir l'action à effectivement entreprendre. La conséquence architecturale est que le raisonnement devient auditable d'une manière que le prompting pur ne permet pas : on peut inspecter l'arbre de recherche, voir quels états le modèle a jugés prometteurs, et retracer pourquoi la réponse finale a été choisie.