Saps frühere Arbeit an COMET (Commonsense Transformers, 2019) baute einen der ersten Versuche des Feldes, maschinenlesbare Repräsentationen alltäglicher sozialer Inferenzen zu erzeugen — dass jemand, der Geld geliehen hat, es wahrscheinlich zurückzahlen will, dass eine Entschuldigung ein vorausgegangenes Fehlverhalten impliziert. Dieselbe Linse zieht sich durch seine Arbeit in der LLM-Ära: Welche Arten sozialen und Common-Sense-Wissens produzieren LLMs flüssig, welche imitieren sie nur oberflächlich, und wo häufen sich die Fehler? RealToxicityPrompts und benachbarte Benchmarks machten diese Frage für sicherheitsrelevante Fälle quantitativ — Modelle, die auf dem offenen Web trainiert wurden, erben die toxischen Muster dieses Webs in messbarer Weise, selbst wenn ihr Alignment-Training versucht, dieses Erbe zu überdecken.

Lesenswert, wenn
man LLM-Verhalten bei sozialem und Common-Sense-Reasoning evaluieren will, nicht nur faktisches QA, mit Benchmarks, die Oberflächen-Compliance von zugrunde liegender Fähigkeit unterscheiden.
Themen
Common-Sense-Wissensrepräsentation in neuronalen Modellen (COMET); LLM-Verhalten bei sozialem und moralischem Reasoning; Toxizitäts-Benchmarks (RealToxicityPrompts) und was sie tatsächlich messen.
Zentrale Arbeiten
COMET commonsense transformers (2019, Ko-Hauptautor); RealToxicityPrompts (2020, Hauptautor); laufende CMU- und AI2-Publikationen zu sozialem und Safety NLP.