Yang a dirigé l'étude de 2023 "Is ChatGPT a General-Purpose NLP Solver?", qui a donné la première réponse sobre, tâche par tâche, à une question que tout le monde tenait pour acquise : sur plus de vingt tâches NLP établies, ChatGPT était fort sur quelques-unes, moyen sur la plupart et mauvais sur certaines — un motif qui compliquait le récit d'une généralité large. Son SALT Lab poursuit une ligne de recherche plus difficile : les modèles de langage dans des rôles où la bonne réponse dépend du contexte social — conseiller, médiateur de conflit, cible de persuasion — et où les modes d'échec ne ressemblent pas à ce que les benchmarks standard révèlent.

À lire lorsque
vous voulez savoir comment les LLM se comportent en dehors des types de tâches pour lesquels ils ont été réglés, surtout lorsque les enjeux humains dépassent les scores de benchmark.
Thèmes
évaluation au niveau des tâches des LLM sur des benchmarks NLP établis; science sociale computationnelle avec des modèles de langage; contexte social comme dimension de l'évaluation.
Travaux clés
"Is ChatGPT a General-Purpose NLP Solver?" (2023); publications du SALT Lab sur le NLP socialement ancré (2022, en cours).