ARC, que Khot a contribué à concevoir chez AI2, est le benchmark de sciences scolaires que les articles actuels sur les LLM citent comme preuve de « capacité de raisonnement » — des questions où le modèle doit déterminer quel scénario explique une observation, une étape qui dépasse la récupération factuelle de surface. Le même instinct anime ses travaux sur Decomposed Prompting (2023, auteur principal) : si une tâche complexe peut être décomposée en un ensemble stable de sous-tâches, on peut traiter chaque sous-tâche avec un prompt isolé puis recomposer les résultats, ce qui donne à la fois une meilleure exactitude et une trace inspectable de ce que le modèle a fait. Ensemble, les deux lignes font d'ARC un outil d'évaluation plus robuste — on peut identifier exactement à quel endroit de la chaîne de raisonnement le modèle a perdu la question.

À lire lorsque
vous voulez que conception de benchmark et méthodologie de prompting soient traitées comme le même problème dans l'évaluation des LLM.
Thèmes
benchmarks de raisonnement (ARC et successeurs); prompting décomposé et schémas de sous-tâches réutilisables; inspection des traces de raisonnement comme partie de l'évaluation.
Travaux clés
AI2 Reasoning Challenge / ARC (2018, co-auteur); Decomposed Prompting (2023, auteur principal); publications en cours d'AI2 sur l'évaluation du raisonnement machine.