Maarten Sap
Могут ли языковые модели производить социальное знание или рассуждать о нём с той же компетентностью, которую они показывают на фактологических задачах, — и что поставлено на карту, когда они не могут.
Более ранняя работа Sap над COMET (Commonsense Transformers, 2019) построила одну из первых попыток сделать машиночитаемые представления повседневных социальных выводов: что человек, занявший деньги, вероятно, захочет их вернуть; что извинение подразумевает предшествующий проступок. Та же оптика проходит через его работы эпохи LLM: какие виды социального знания и знания здравого смысла LLM производят бегло, а какие лишь поверхностно имитируют, и где сгруппированы провалы. RealToxicityPrompts и смежные benchmark-и сделали этот вопрос количественным для случаев, важных для безопасности: модели, обученные на открытом вебе, наследуют токсичные паттерны этого веба измеримым образом, даже когда обучение выравниванию (alignment) пытается это наследование замаскировать.