Maarten Sap
La question de savoir si les modèles de langage peuvent produire de la connaissance sociale ou raisonner à son sujet avec la même compétence qu'ils montrent sur les tâches factuelles — et ce qui est en jeu lorsqu'ils n'y parviennent pas.
Les premiers travaux de Sap sur COMET (Commonsense Transformers, 2019) ont construit l'une des premières tentatives du domaine pour produire des représentations lisibles par machine d'inférences sociales quotidiennes — qu'une personne qui a emprunté de l'argent voudra probablement le rembourser, qu'une excuse implique un tort préalable. La même perspective traverse ses travaux à l'ère des LLM : quels types de connaissances sociales et de sens commun les LLM produisent-ils avec aisance, par opposition à ceux qu'ils imitent superficiellement, et où ces échecs se concentrent-ils ? RealToxicityPrompts et les benchmarks adjacents ont rendu cette question quantitative pour les cas pertinents pour la sûreté — les modèles entraînés sur le web ouvert héritent des motifs toxiques de ce web de façon mesurable, même lorsque leur entraînement d'alignement tente de masquer cet héritage.