Более ранняя работа Sap над COMET (Commonsense Transformers, 2019) построила одну из первых попыток сделать машиночитаемые представления повседневных социальных выводов: что человек, занявший деньги, вероятно, захочет их вернуть; что извинение подразумевает предшествующий проступок. Та же оптика проходит через его работы эпохи LLM: какие виды социального знания и знания здравого смысла LLM производят бегло, а какие лишь поверхностно имитируют, и где сгруппированы провалы. RealToxicityPrompts и смежные benchmark-и сделали этот вопрос количественным для случаев, важных для безопасности: модели, обученные на открытом вебе, наследуют токсичные паттерны этого веба измеримым образом, даже когда обучение выравниванию (alignment) пытается это наследование замаскировать.

Стоит читать, когда
вы хотите оценивать поведение LLM в социальном рассуждении и рассуждении здравого смысла, а не только в фактологическом QA, с benchmark-ами, которые отличают поверхностное следование требованиям от лежащей под ним реальной способности.
Темы
представление знаний здравого смысла в нейронных моделях (COMET); поведение LLM в социальном и моральном рассуждении; benchmark-и токсичности (RealToxicityPrompts) и то, что они на самом деле измеряют.
Ключевые работы
COMET commonsense transformers (2019, соведущий автор); RealToxicityPrompts (2020, ведущий автор); текущие публикации CMU и AI2 по социальному NLP и безопасности в NLP.