Spider, que Yasunaga coescribió como parte de una colaboración doctoral Yale-Stanford, ha sido el benchmark canónico de traducción text-to-SQL desde 2018: una tarea que parece engañosamente simple («convierte esta pregunta en una consulta SQL»), pero que en realidad exige al modelo vincular entidades de lenguaje natural con columnas de esquema, resolver agregaciones y estructurar joins correctamente. La razón por la que esto importa para evaluar los LLM como sistemas de razonamiento es que text-to-SQL tiene una verdad de referencia estricta: la consulta o bien se ejecuta y devuelve las filas correctas, o no. Su trabajo posterior en QA-GNN y razonamiento aumentado por grafos de conocimiento extiende la misma postura: razonamiento sobre conocimiento estructurado que produce respuestas verificables.

Vale la pena seguirlo cuando
se quiere evaluar razonamiento de LLM en tareas con verdad de referencia estricta y ejecutable, en lugar de corrección por juicio humano.
Temas
evaluación text-to-SQL (Spider); respuesta a preguntas aumentada por grafos de conocimiento; tareas de razonamiento con criterios de corrección verificables.
Obras clave
benchmark text-to-SQL Spider (2018, coautor); QA-GNN (2021, autor principal); publicaciones en curso sobre razonamiento sobre conocimiento estructurado.