El trabajo temprano de Sap sobre COMET (Commonsense Transformers, 2019) construyó uno de los primeros intentos del campo de hacer representaciones legibles por máquina de inferencias sociales cotidianas: que alguien que pidió dinero prestado probablemente querrá devolverlo, que una disculpa implica una falta previa. La misma lente atraviesa su trabajo de la era LLM: qué tipos de conocimiento social y de sentido común producen los LLM con fluidez frente a cuáles imitan superficialmente, y dónde se agrupan los fallos. RealToxicityPrompts y benchmarks adyacentes hicieron cuantitativa esa pregunta para casos relevantes para la seguridad: los modelos entrenados en la web abierta heredan los patrones tóxicos de esa web de maneras medibles, incluso cuando su entrenamiento de alineación intenta tapar esa herencia.

Vale la pena seguirlo cuando
se quiere evaluar el comportamiento de LLM en razonamiento social y de sentido común, no solo en QA factual, con benchmarks que distinguen el cumplimiento superficial de la capacidad subyacente.
Temas
representación de conocimiento de sentido común en modelos neuronales (COMET); comportamiento de LLM en razonamiento social y moral; benchmarks de toxicidad (RealToxicityPrompts) y lo que realmente miden.
Obras clave
COMET commonsense transformers (2019, coautor principal); RealToxicityPrompts (2020, autor principal); publicaciones en curso de CMU y AI2 sobre NLP social y de seguridad.