Ashish Sabharwal
Ce que la recherche classique en raisonnement formel peut apporter à l'évaluation de la question de savoir si les LLM raisonnent réellement — et comment distinguer cela d'un langage en forme de raisonnement qui tombe par hasard sur la bonne réponse.
Sabharwal est arrivé à la recherche sur les LLM depuis le raisonnement formel et la satisfiabilité — des domaines où « le système raisonne-t-il correctement » a un sens précis, mesuré par rapport à des spécifications logiques et vérifiable par des tests opérationnels. Ce bagage transparaît dans ses travaux plus récents sur l'évaluation du raisonnement des LLM : une tendance à examiner si la structure du raisonnement correspond à la structure requise par le problème, en plus de vérifier si la réponse finale se trouve être correcte. ARC et les benchmarks similaires procèdent de cette posture — conçus pour que la fluidité de surface ne puisse pas se substituer à l'inférence réelle.