Pour les questions complexes — « quelle est la population totale des pays dont la capitale commence par “B” ? » — la différence entre connaître la réponse et raisonner jusqu'à elle compte, mais la plupart des évaluations de réponse aux questions écrasent les deux dans une seule note d'exactitude. Les travaux BREAK et QDMR de Berant ont formalisé l'alternative : décomposer chaque question complexe en étapes atomiques de raisonnement qu'elle implique, puis vérifier si le modèle est passé par ces étapes, et non seulement si la réponse finale correspondait. Le benchmark de compréhension en lecture DROP (2019, co-auteur) a quantifié à quel point les LLM actuels perdent lorsque la question exige de composer effectivement des faits intermédiaires pour atteindre la réponse.

À lire lorsque
vous voulez évaluer non seulement si un LLM a obtenu la bonne réponse, mais s'il y est parvenu par un raisonnement structurellement honnête.
Thèmes
décomposition des questions en étapes atomiques de raisonnement (QDMR, BREAK); compréhension en lecture compositionnelle (DROP); écart entre correction de la réponse et correction du raisonnement.
Travaux clés
jeu de données BREAK avec annotations QDMR (2020, auteur principal); benchmark de compréhension en lecture DROP (2019, co-auteur); travaux en cours à Tel Aviv et Google DeepMind sur le raisonnement compositionnel.