Статья 2023 года "Do LLMs Understand Social Knowledge?", где Jurgens был старшим соавтором, прогнала современные LLM через набор тестов, построенных на социолингвистических исследованиях: импликатуры, косвенные речевые акты, конвенционализированные маркеры вежливости, социальные выводы, которые компетентный человек делает не задумываясь. Результаты оказались достаточно смешанными, чтобы иметь значение: LLM, набирающие высокие баллы на benchmarks фактологического QA, систематически ошибались в социальных выводах, с которыми справляется любой достаточно социализированный человек, особенно когда социальный контекст был неамериканским или не-мейнстримным. Для ai100 это связано с вопросом, о котором приходится думать: когда движок рекомендует один бренд вместо другого, какой социальный сигнал он считывает из запроса и интерпретировал бы человек тот же запрос таким же образом.

Стоит читать, когда
вам нужна оценка LLM, заземлённая в социолингвистике: проверка того, понимает ли модель, что люди имеют в виду, а не только то, что они буквально говорят.
Темы
социолингвистическая оценка LLM; вычислительная социальная наука с языковыми моделями; разрыв между фактологической компетентностью и социальной компетентностью AI-систем.
Ключевые работы
"Do LLMs Understand Social Knowledge?" (2023, старший соавтор); корпус работ по социолингвистике и вычислительной социальной науке; публикации U Michigan, соединяющие NLP и исследования социальных наук.