Spider, que Yasunaga a co-écrit dans le cadre d'une collaboration doctorale Yale-Stanford, est depuis 2018 le benchmark canonique de traduction texte-vers-SQL — une tâche faussement simple (« transformer cette question en requête SQL ») qui exige en réalité du modèle qu'il lie des entités en langue naturelle à des colonnes de schéma, résolve des agrégations et structure correctement des jointures. La raison pour laquelle cela compte pour évaluer les LLM comme systèmes de raisonnement est que le texte-vers-SQL dispose d'une vérité de terrain stricte : la requête s'exécute et renvoie les bonnes lignes, ou elle ne le fait pas. Ses travaux ultérieurs sur QA-GNN et le raisonnement augmenté par graphe de connaissances prolongent la même posture — raisonner sur une connaissance structurée qui produit des réponses vérifiables.

À lire lorsque
vous voulez évaluer le raisonnement des LLM sur des tâches dotées d'une vérité de terrain stricte et exécutable, plutôt que d'une correction fondée sur le jugement humain.
Thèmes
évaluation texte-vers-SQL (Spider); question-réponse augmentée par graphe de connaissances; tâches de raisonnement à critères de correction vérifiables.
Travaux clés
benchmark text-to-SQL Spider (2018, co-auteur); QA-GNN (2021, auteur principal); publications en cours sur le raisonnement sur connaissance structurée.