Yang leitete die 2023 erschienene Studie „Is ChatGPT a General-Purpose NLP Solver?“, die die erste nüchterne aufgabenweise Antwort auf eine Frage gab, die damals viele bereits vorausgesetzt hatten: Über mehr als zwanzig etablierte NLP-Aufgaben hinweg war ChatGPT in einigen stark, in den meisten mittelmäßig und in einigen schwach — ein Muster, das die Erzählung breiter Allgemeinheit komplizierter machte. Ihr SALT Lab verfolgt die schwierigere Fragestellung weiter: Sprachmodelle in Rollen, in denen die richtige Antwort vom sozialen Kontext abhängt — Berater, Konfliktvermittler, Ziel von Überzeugungsversuchen — und in denen die Fehlermodi anders aussehen als das, was Standard-benchmarks offenlegen.

Lesenswert, wenn
man wissen will, wie LLMs sich außerhalb der Aufgaben verhalten, auf die sie abgestimmt wurden, besonders bei Aufgaben, deren menschliche Einsätze höher sind als benchmark-Scores.
Themen
aufgabenbezogene Evaluation von LLMs auf etablierten NLP-benchmarks; Computational Social Science mit Sprachmodellen; sozialer Kontext als Bewertungsdimension.
Zentrale Arbeiten
„Is ChatGPT a General-Purpose NLP Solver?“ (2023); SALT-Lab-Publikationen zu socially-grounded NLP (2022, laufend).