David Jurgens
Могут ли языковые модели, хорошо справляющиеся с фактологическими вопросами, справляться и с тем социальным знанием, которое определяет, что люди на самом деле имеют в виду, когда что-то говорят.
Статья 2023 года "Do LLMs Understand Social Knowledge?", где Jurgens был старшим соавтором, прогнала современные LLM через набор тестов, построенных на социолингвистических исследованиях: импликатуры, косвенные речевые акты, конвенционализированные маркеры вежливости, социальные выводы, которые компетентный человек делает не задумываясь. Результаты оказались достаточно смешанными, чтобы иметь значение: LLM, набирающие высокие баллы на benchmarks фактологического QA, систематически ошибались в социальных выводах, с которыми справляется любой достаточно социализированный человек, особенно когда социальный контекст был неамериканским или не-мейнстримным. Для ai100 это связано с вопросом, о котором приходится думать: когда движок рекомендует один бренд вместо другого, какой социальный сигнал он считывает из запроса и интерпретировал бы человек тот же запрос таким же образом.