Tushar Khot
Was „Reasoning-Fähigkeit“ tatsächlich bedeutet, wenn man sie auf einen Benchmark bringen will — und was sich ändert, wenn man zugleich versucht, das Modell durch strukturiertes Prompting zum logischen Schließen (Reasoning) anzuleiten.
ARC, an dessen Design Khot bei AI2 mitwirkte, ist der Benchmark für Naturwissenschaftsfragen auf Grundschulniveau, den aktuelle LLM-Arbeiten als Beleg für „Reasoning-Fähigkeit“ zitieren — Fragen, bei denen das Modell herausarbeiten muss, welches Szenario eine Beobachtung erklärt, ein Schritt, der über oberflächliches Fakten-Retrieval hinausgeht. Derselbe Instinkt treibt seine Arbeit zu Decomposed Prompting (2023, Hauptautor): Wenn sich eine komplexe Aufgabe in eine stabile Menge von Teilaufgaben zerlegen lässt, kann man jede Teilaufgabe isoliert prompten und die Ergebnisse wieder zusammensetzen; das bringt sowohl höhere Genauigkeit als auch eine inspizierbare Spur dessen, was das Modell getan hat. Zusammen machen die beiden Linien ARC zu einem stärkeren Evaluationswerkzeug — man kann genau identifizieren, an welcher Stelle der Reasoning-Kette das Modell die Frage verloren hat.