Spider, das Yasunaga im Rahmen einer Yale-Stanford-Promotionskollaboration mitverfasste, ist seit 2018 der kanonische Benchmark für Text-to-SQL-Übersetzung — eine Aufgabe, die täuschend einfach aussieht („verwandle diese Frage in eine SQL-Abfrage“), aber tatsächlich verlangt, dass das Modell natürlichsprachliche Entitäten an Schemaspalten bindet, Aggregationen auflöst und Joins korrekt strukturiert. Der Grund, warum das für die Evaluation von LLMs als Reasoning-Systeme wichtig ist, liegt darin, dass Text-to-SQL eine harte Ground Truth hat: Die Abfrage läuft und liefert die richtigen Zeilen, oder sie tut es nicht. Seine spätere Arbeit an QA-GNN und Wissensgraph-gestütztem logischem Schließen (Reasoning) erweitert dieselbe Haltung — logisches Schließen (Reasoning) über strukturiertes Wissen, das überprüfbare Antworten ergibt.

Lesenswert, wenn
man LLM-Reasoning bei Aufgaben mit strikter, ausführbarer Ground Truth evaluieren will, statt mit Korrektheit durch menschliche Beurteilung.
Themen
Text-to-SQL-Evaluation (Spider); Wissensgraph-gestütztes Question Answering; Reasoning-Aufgaben mit überprüfbaren Korrektheitskriterien.
Zentrale Arbeiten
Spider text-to-SQL benchmark (2018, Mitautor); QA-GNN (2021, Hauptautor); laufende Publikationen zu logischem Schließen (Reasoning) über strukturiertes Wissen.