El artículo de 2023 "Do LLMs Understand Social Knowledge?", con Jurgens como coautor sénior, sometió a LLM modernos a una batería de pruebas construidas a partir de investigación sociolingüística: implicatura, actos de habla indirectos, marcadores convencionalizados de cortesía, las inferencias sociales que un oyente humano competente hace sin pensarlo. Los resultados fueron lo bastante mixtos como para importar: LLM que puntuaban alto en benchmarks de QA factual cometían errores sistemáticos en inferencias sociales que cualquier humano razonablemente socializado acierta, especialmente cuando el contexto social no era estadounidense ni mayoritario. Para ai100, esto conecta con una pregunta que tenemos que pensar: cuando un motor recomienda una marca en lugar de otra, qué señal social está leyendo el motor en la consulta, y si un humano que leyera la misma consulta interpretaría esa señal del mismo modo.

Vale la pena seguirlo cuando
se quiere evaluación de LLM anclada en sociolingüística: probar si el modelo entiende lo que los humanos quieren decir, no solo lo que dicen literalmente.
Temas
evaluación sociolingüística de LLM; ciencia social computacional con modelos de lenguaje; brecha entre competencia factual y competencia social en sistemas de IA.
Obras clave
"Do LLMs Understand Social Knowledge?" (2023, coautor sénior); trayectoria en sociolingüística y ciencia social computacional; publicaciones de U Michigan que conectan NLP e investigación en ciencias sociales.