Yang руководила исследованием "Is ChatGPT a General-Purpose NLP Solver?" (2023), которое дало первый трезвый, по-задачный ответ на вопрос, который многие уже считали решённым: на более чем двадцати устоявшихся NLP-задачах ChatGPT оказался силён в нескольких, посредственен в большинстве и слаб в некоторых — картина, которая усложнила нарратив о широкой универсальности. Её SALT Lab продолжает более трудную линию исследования: языковые модели в ролях, где правильный ответ зависит от социального контекста — консультант, медиатор конфликта, адресат убеждения, — и где режимы отказа выглядят иначе, чем показывают стандартные benchmark.

Стоит читать, когда
вы хотите понять, как LLM ведут себя за пределами задач, под которые их настраивали, особенно там, где человеческие ставки выше, чем баллы benchmark.
Темы
по-задачная оценка LLM на устоявшихся NLP benchmark; вычислительная социальная наука с языковыми моделями; социальный контекст как измерение оценки.
Ключевые работы
"Is ChatGPT a General-Purpose NLP Solver?" (2023); публикации SALT Lab по socially-grounded NLP (2022, продолжается).