Zhiting Hu
Ein Sprachmodell als eine Komponente in einem größeren Planungssystem zu behandeln — statt es das logische Schließen (Reasoning) End-to-End im eigenen Kopf erledigen zu lassen.
Der dominante Rahmen für LLM-Reasoning besteht darin, alles innerhalb des Sprachmodells zu halten: Es per prompt dazu bringen, Reasoning-Schritte zu produzieren, aus der entstehenden Verteilung zu sampeln und zu hoffen, dass die richtige Antwort herausfällt. RAP (Reasoning as Planning, 2023, mit Hu als Seniorautorin) setzt anders an: Das LLM wird als Weltmodell genutzt, das vorhersagt, was nach einer Kandidatenaktion passiert, und mit klassischer Monte Carlo Tree Search kombiniert, um zu wählen, welche Handlung tatsächlich ausgeführt wird. Die architektonische Konsequenz ist, dass logisches Schließen (Reasoning) auditierbar wird, wie es reines Prompting nicht ist: Man kann den Suchbaum inspizieren, sehen, welche Zustände das Modell als vielversprechend bewertet hat, und nachverfolgen, warum die finale Antwort gewählt wurde.