Tushar Khot
Ce que « capacité de raisonnement » signifie réellement comme chose que l'on peut placer dans un benchmark — et ce qui change lorsque l'on essaie aussi d'amener le modèle à raisonner par prompting structuré.
ARC, que Khot a contribué à concevoir chez AI2, est le benchmark de sciences scolaires que les articles actuels sur les LLM citent comme preuve de « capacité de raisonnement » — des questions où le modèle doit déterminer quel scénario explique une observation, une étape qui dépasse la récupération factuelle de surface. Le même instinct anime ses travaux sur Decomposed Prompting (2023, auteur principal) : si une tâche complexe peut être décomposée en un ensemble stable de sous-tâches, on peut traiter chaque sous-tâche avec un prompt isolé puis recomposer les résultats, ce qui donne à la fois une meilleure exactitude et une trace inspectable de ce que le modèle a fait. Ensemble, les deux lignes font d'ARC un outil d'évaluation plus robuste — on peut identifier exactement à quel endroit de la chaîne de raisonnement le modèle a perdu la question.