Ashish Sabharwal
Was klassische Forschung zu formalem logischem Schließen (Reasoning) dazu beitragen kann, zu evaluieren, ob moderne LLMs tatsächlich logisch schließen — und wie man das von Sprache unterscheidet, die nur nach Reasoning aussieht und zufällig bei der richtigen Antwort landet.
Sabharwal kam aus einem Hintergrund in formalem logischem Schließen und Erfüllbarkeitsprüfung (SAT) zur LLM-Forschung — Bereichen, in denen „schließt das System korrekt?“ eine präzise Bedeutung hat, gemessen an logischen Spezifikationen und überprüfbar durch operationale Tests. Dieser Hintergrund zeigt sich in seiner neueren Arbeit zur Evaluation von LLM-Reasoning: der Neigung, nicht nur darauf zu schauen, ob die Endantwort zufällig korrekt ist, sondern ob die Struktur des logischen Schließens zu der Struktur passt, die das Problem verlangt. ARC und ähnliche Benchmarks sind ein Ergebnis dieser Haltung — so gestaltet, dass Oberflächenfluenz kein Ersatz für tatsächliche Inferenz ist.