Spider, который Yasunaga был соавтором в рамках Yale-Stanford PhD-коллаборации, с 2018 года остаётся каноническим benchmark-ом для text-to-SQL-перевода: задача выглядит обманчиво простой («преврати этот вопрос в SQL-запрос»), но на деле требует от модели связать сущности естественного языка с колонками схемы, разрешить агрегации и корректно построить join-ы. Для оценки LLM как систем рассуждения это важно потому, что у text-to-SQL есть жёсткий исполняемый эталон: запрос либо запускается и возвращает правильные строки, либо нет. Его последующая работа над QA-GNN и рассуждением с добавлением графов знаний продолжает ту же установку — рассуждение над структурированным знанием, которое даёт проверяемые ответы.

Стоит читать, когда
вы хотите оценивать рассуждение LLM на задачах со строгим исполняемым эталоном, а не с корректностью по человеческому суждению.
Темы
оценка text-to-SQL (Spider); question answering с добавлением графов знаний; задачи рассуждения с проверяемыми критериями правильности.
Ключевые работы
Spider text-to-SQL benchmark (2018, соавтор); QA-GNN (2021, ведущий автор); текущие публикации по рассуждению над структурированным знанием.