Maarten Sap
Ob Sprachmodelle soziales Wissen mit derselben Kompetenz erzeugen oder darüber logisch schließen können, wie sie sie bei faktischen Aufgaben zeigen — und was auf dem Spiel steht, wenn sie es nicht können.
Saps frühere Arbeit an COMET (Commonsense Transformers, 2019) baute einen der ersten Versuche des Feldes, maschinenlesbare Repräsentationen alltäglicher sozialer Inferenzen zu erzeugen — dass jemand, der Geld geliehen hat, es wahrscheinlich zurückzahlen will, dass eine Entschuldigung ein vorausgegangenes Fehlverhalten impliziert. Dieselbe Linse zieht sich durch seine Arbeit in der LLM-Ära: Welche Arten sozialen und Common-Sense-Wissens produzieren LLMs flüssig, welche imitieren sie nur oberflächlich, und wo häufen sich die Fehler? RealToxicityPrompts und benachbarte Benchmarks machten diese Frage für sicherheitsrelevante Fälle quantitativ — Modelle, die auf dem offenen Web trainiert wurden, erben die toxischen Muster dieses Webs in messbarer Weise, selbst wenn ihr Alignment-Training versucht, dieses Erbe zu überdecken.