Jonathan Berant
Si un modèle de langage effectue réellement les étapes de raisonnement nécessaires pour répondre à une question — ou s'il produit seulement une réponse qui se trouve être correcte.
Pour les questions complexes — « quelle est la population totale des pays dont la capitale commence par “B” ? » — la différence entre connaître la réponse et raisonner jusqu'à elle compte, mais la plupart des évaluations de réponse aux questions écrasent les deux dans une seule note d'exactitude. Les travaux BREAK et QDMR de Berant ont formalisé l'alternative : décomposer chaque question complexe en étapes atomiques de raisonnement qu'elle implique, puis vérifier si le modèle est passé par ces étapes, et non seulement si la réponse finale correspondait. Le benchmark de compréhension en lecture DROP (2019, co-auteur) a quantifié à quel point les LLM actuels perdent lorsque la question exige de composer effectivement des faits intermédiaires pour atteindre la réponse.