Sabharwal est arrivé à la recherche sur les LLM depuis le raisonnement formel et la satisfiabilité — des domaines où « le système raisonne-t-il correctement » a un sens précis, mesuré par rapport à des spécifications logiques et vérifiable par des tests opérationnels. Ce bagage transparaît dans ses travaux plus récents sur l'évaluation du raisonnement des LLM : une tendance à examiner si la structure du raisonnement correspond à la structure requise par le problème, en plus de vérifier si la réponse finale se trouve être correcte. ARC et les benchmarks similaires procèdent de cette posture — conçus pour que la fluidité de surface ne puisse pas se substituer à l'inférence réelle.

À lire lorsque
vous voulez une évaluation du raisonnement des LLM ancrée dans l'ancienne tradition du raisonnement formel, où la « correction » avait un sens opérationnel avant l'arrivée du apprentissage profond.
Thèmes
raisonnement formel et résolution SAT appliqués à l'évaluation des LLM; inspection des traces de raisonnement dans les benchmarks de QA; pont entre l'inférence classique en IA et le comportement actuel des LLM.
Travaux clés
AI2 Reasoning Challenge / ARC (2018, co-auteur); travaux pré-LLM sur l'inférence traitable et SAT; publications récentes d'AI2 sur l'évaluation du raisonnement à l'ère des LLM.