Jonathan Berant
Ob ein Sprachmodell tatsächlich die Schritte des logischen Schließens (Reasoning) ausführt, die nötig sind, um eine Frage zu beantworten — oder nur eine Antwort produziert, die zufällig richtig ist.
Bei komplexen Fragen — „Wie groß ist die Gesamtbevölkerung der Länder, deren Hauptstadt mit ‚B‘ beginnt?“ — zählt der Unterschied zwischen dem Kennen der Antwort und ihrer logischen Herleitung; die meiste QA-Evaluation lässt beides jedoch zu einem einzigen Korrektheitsscore zusammenfallen. Berants BREAK- und QDMR-Arbeit formalisierte die Alternative: Jede komplexe Frage in die atomaren Schritte des logischen Schließens (Reasoning) zerlegen, die sie impliziert, und dann prüfen, ob das Modell diese Schritte durchlaufen hat, statt nur zu prüfen, ob die finale Antwort übereinstimmte. Der DROP-Reading-Comprehension-Benchmark (2019, Mitautor) quantifizierte, wie viel aktuelle LLMs verlieren, wenn die Frage verlangt, Zwischenfakten tatsächlich zu komponieren, um zur Antwort zu gelangen.