Bei komplexen Fragen — „Wie groß ist die Gesamtbevölkerung der Länder, deren Hauptstadt mit ‚B‘ beginnt?“ — zählt der Unterschied zwischen dem Kennen der Antwort und ihrer logischen Herleitung; die meiste QA-Evaluation lässt beides jedoch zu einem einzigen Korrektheitsscore zusammenfallen. Berants BREAK- und QDMR-Arbeit formalisierte die Alternative: Jede komplexe Frage in die atomaren Schritte des logischen Schließens (Reasoning) zerlegen, die sie impliziert, und dann prüfen, ob das Modell diese Schritte durchlaufen hat, statt nur zu prüfen, ob die finale Antwort übereinstimmte. Der DROP-Reading-Comprehension-Benchmark (2019, Mitautor) quantifizierte, wie viel aktuelle LLMs verlieren, wenn die Frage verlangt, Zwischenfakten tatsächlich zu komponieren, um zur Antwort zu gelangen.

Lesenswert, wenn
man nicht nur evaluieren will, ob ein LLM die Antwort richtig hatte, sondern ob es sich auf strukturell redliche Weise zu ihr logisch durchgearbeitet hat.
Themen
Fragezerlegung in atomare Schritte des logischen Schließens (Reasoning) (QDMR, BREAK); kompositionelles Leseverständnis (DROP); die Lücke zwischen Antwortkorrektheit und Korrektheit des logischen Schließens (Reasoning).
Zentrale Arbeiten
BREAK-Datensatz mit QDMR-Annotationen (2020, Hauptautor); DROP-Reading-Comprehension-Benchmark (2019, Mitautor); laufende Arbeit in Tel Aviv und bei Google DeepMind zu kompositionellem logischem Schließen (Reasoning).