Yang lideró el estudio de 2023 "Is ChatGPT a General-Purpose NLP Solver?", que dio la primera respuesta sobria, tarea por tarea, a una pregunta que todo el mundo había estado dando por supuesta: en más de veinte tareas establecidas de NLP, ChatGPT era fuerte en unas pocas, mediocre en la mayoría y malo en algunas, un patrón que complicaba la narrativa de una generalidad amplia. Su SALT Lab continúa una línea de investigación más difícil: modelos de lenguaje en roles donde la respuesta correcta depende del contexto social —consejero, mediador de conflictos, destinatario de persuasión— y donde los modos de fallo tienen un aspecto distinto al que revelan los benchmarks estándar.

Vale la pena seguirlo cuando
se quiere saber cómo se comportan los LLM fuera de los tipos de tareas para los que fueron ajustados, especialmente tareas donde lo que está en juego para los humanos pesa más que las puntuaciones de benchmark.
Temas
evaluación a nivel de tarea de LLM en benchmarks establecidos de NLP; ciencia social computacional con modelos de lenguaje; el contexto social como dimensión de evaluación.
Obras clave
"Is ChatGPT a General-Purpose NLP Solver?" (2023); publicaciones de SALT Lab sobre NLP socialmente fundamentado (2022, en curso).