Yejin Choi
Ce qu'il faudrait pour qu'un modèle de langage possède ce que les humains ont en abondance et ce qui manque de façon fiable aux LLM — le sens commun.
Choi est la voix la plus constante du NLP pour soutenir que le passage à l'échelle seul ne produit pas de raisonnement de sens commun, et son groupe a construit les benchmarks pour le démontrer : HellaSwag (où les humains obtiennent 95 % de bonnes réponses et où les modèles de langage de 2019 obtenaient 47 %), PIQA pour le sens commun physique, SIQA pour le social, COMET pour les graphes de connaissances de sens commun. Le cadrage qu'elle a apporté au domaine — l'évaluation actuelle crédite les modèles pour un appariement de motifs de surface sur des tâches où les humains utilisent de véritables modèles du monde — a bien vieilli, à mesure que de plus grands LLM se sont améliorés sur les benchmarks tout en continuant à produire les échecs de raisonnement que ces benchmarks étaient conçus pour exposer. Pour ai100, c'est la littérature qui justifie notre scepticisme face aux chiffres de benchmark en gros titre : un modèle qui obtient 92 % sur des benchmarks de sens commun peut encore faire quelque chose de différent de ce que font les humains pour obtenir 95 %, et cette différence compte pour le comportement en aval.