Maarten Sap
Si los modelos de lenguaje pueden producir conocimiento social o razonar sobre él con la misma competencia que muestran en tareas factuales, y qué está en juego cuando no pueden.
El trabajo temprano de Sap sobre COMET (Commonsense Transformers, 2019) construyó uno de los primeros intentos del campo de hacer representaciones legibles por máquina de inferencias sociales cotidianas: que alguien que pidió dinero prestado probablemente querrá devolverlo, que una disculpa implica una falta previa. La misma lente atraviesa su trabajo de la era LLM: qué tipos de conocimiento social y de sentido común producen los LLM con fluidez frente a cuáles imitan superficialmente, y dónde se agrupan los fallos. RealToxicityPrompts y benchmarks adyacentes hicieron cuantitativa esa pregunta para casos relevantes para la seguridad: los modelos entrenados en la web abierta heredan los patrones tóxicos de esa web de maneras medibles, incluso cuando su entrenamiento de alineación intenta tapar esa herencia.