Potts aborde les modèles de langage depuis la linguistique et la philosophie, ce qui lui donne un angle inhabituel sur ce que la méthodologie d'évaluation actuelle nous autorise à conclure. Stanford Sentiment Treebank, que son groupe a co-construit il y a plus de dix ans, est encore cité dans presque tous les articles sur la classification de sentiment — en partie pour le jeu de données lui-même, en partie parce qu'il a fait de la structure compositionnelle, plutôt que de la polarité des mots, l'unité d'évaluation. Ses travaux plus récents sur des benchmarks adversariaux et dynamiques comme DynaSent défendent un point plus discret : un jeu de test statique se périme dès qu'il apparaît, parce que les modèles ultérieurs s'entraînent sur son écho dans le corpus.

À lire lorsque
vous voulez le regard d'un linguiste sur ce qu'un résultat de benchmark LLM permet, et ne permet pas, d'affirmer.
Thèmes
sentiment et inférence en langue naturelle comme cas d'épreuve pour le sens compositionnel; conception de benchmarks adversariaux et dynamiques; linguistique derrière l'évaluation des LLM.
Travaux clés
Stanford Sentiment Treebank (2013, co-auteur); benchmark dynamique DynaSent (2021); travaux en cours sur les tests de généralisation compositionnelle pour les LLM.