Choi est la voix la plus constante du NLP pour soutenir que le passage à l'échelle seul ne produit pas de raisonnement de sens commun, et son groupe a construit les benchmarks pour le démontrer : HellaSwag (où les humains obtiennent 95 % de bonnes réponses et où les modèles de langage de 2019 obtenaient 47 %), PIQA pour le sens commun physique, SIQA pour le social, COMET pour les graphes de connaissances de sens commun. Le cadrage qu'elle a apporté au domaine — l'évaluation actuelle crédite les modèles pour un appariement de motifs de surface sur des tâches où les humains utilisent de véritables modèles du monde — a bien vieilli, à mesure que de plus grands LLM se sont améliorés sur les benchmarks tout en continuant à produire les échecs de raisonnement que ces benchmarks étaient conçus pour exposer. Pour ai100, c'est la littérature qui justifie notre scepticisme face aux chiffres de benchmark en gros titre : un modèle qui obtient 92 % sur des benchmarks de sens commun peut encore faire quelque chose de différent de ce que font les humains pour obtenir 95 %, et cette différence compte pour le comportement en aval.

À lire lorsque
vous voulez une méthodologie d'évaluation des LLM ancrée dans l'écart entre performance en benchmark et compétence réelle de raisonnement — par quelqu'un qui défend cet argument depuis avant qu'il ne devienne à la mode.
Thèmes
évaluation du raisonnement de sens commun (HellaSwag, PIQA, SIQA, COMET); écart méthodologique entre scores de benchmark et compétence de raisonnement; travaux de long terme sur ce que l'évaluation en NLP mesure réellement.
Travaux clés
HellaSwag (2019, auteure senior); PIQA: Reasoning about Physical Commonsense (2020, co-auteure); COMET: Commonsense Transformers for Automatic Knowledge Graph Construction (2019, auteure senior); Defending Against Neural Fake News (Grover, 2019, auteure senior); ensemble de travaux de l'AI2 Mosaic Team sur l'IA de sens commun.