ARC, an dessen Design Khot bei AI2 mitwirkte, ist der Benchmark für Naturwissenschaftsfragen auf Grundschulniveau, den aktuelle LLM-Arbeiten als Beleg für „Reasoning-Fähigkeit“ zitieren — Fragen, bei denen das Modell herausarbeiten muss, welches Szenario eine Beobachtung erklärt, ein Schritt, der über oberflächliches Fakten-Retrieval hinausgeht. Derselbe Instinkt treibt seine Arbeit zu Decomposed Prompting (2023, Hauptautor): Wenn sich eine komplexe Aufgabe in eine stabile Menge von Teilaufgaben zerlegen lässt, kann man jede Teilaufgabe isoliert prompten und die Ergebnisse wieder zusammensetzen; das bringt sowohl höhere Genauigkeit als auch eine inspizierbare Spur dessen, was das Modell getan hat. Zusammen machen die beiden Linien ARC zu einem stärkeren Evaluationswerkzeug — man kann genau identifizieren, an welcher Stelle der Reasoning-Kette das Modell die Frage verloren hat.

Lesenswert, wenn
man Benchmark-Design und Prompting-Methodik als dasselbe Problem in der LLM-Evaluation behandeln will.
Themen
Reasoning-Benchmarks (ARC und Nachfolger); Decomposed Prompting und wiederverwendbare Teilaufgabenmuster; Inspektion von Reasoning-Traces als Teil der Evaluation.
Zentrale Arbeiten
AI2 Reasoning Challenge / ARC (2018, Mitautor); Decomposed Prompting (2023, Hauptautor); laufende AI2-Publikationen zur Evaluation maschinellen logischen Schließens.