Les premiers travaux de Sap sur COMET (Commonsense Transformers, 2019) ont construit l'une des premières tentatives du domaine pour produire des représentations lisibles par machine d'inférences sociales quotidiennes — qu'une personne qui a emprunté de l'argent voudra probablement le rembourser, qu'une excuse implique un tort préalable. La même perspective traverse ses travaux à l'ère des LLM : quels types de connaissances sociales et de sens commun les LLM produisent-ils avec aisance, par opposition à ceux qu'ils imitent superficiellement, et où ces échecs se concentrent-ils ? RealToxicityPrompts et les benchmarks adjacents ont rendu cette question quantitative pour les cas pertinents pour la sûreté — les modèles entraînés sur le web ouvert héritent des motifs toxiques de ce web de façon mesurable, même lorsque leur entraînement d'alignement tente de masquer cet héritage.

À lire lorsque
vous voulez évaluer le comportement des LLM sur le raisonnement social et de sens commun, et pas seulement sur la QA factuelle, avec des benchmarks qui distinguent conformité de surface et capacité sous-jacente.
Thèmes
représentation de connaissances de sens commun dans les modèles neuronaux (COMET); comportement des LLM sur le raisonnement social et moral; benchmarks de toxicité (RealToxicityPrompts) et ce qu'ils mesurent réellement.
Travaux clés
COMET commonsense transformers (2019, co-auteur principal); RealToxicityPrompts (2020, auteur principal); publications en cours de CMU et AI2 sur le NLP social et de sûreté.