Goldberg escribió uno de los manuales estándar de NLP de la era neuronal (2017) y desde entonces ha dedicado años a presionar sobre una pregunta que se vuelve más difícil cuanto más capaces son los modelos: ¿la explicación que da un LLM de su respuesta es la causa real de esa respuesta, o una coartada plausible producida a posteriori? Su trabajo sobre la fidelidad (a la fuente) de las explicaciones generadas recuerda de forma constante que «el modelo dijo por qué hizo X» y «sabemos por qué el modelo hizo X» son afirmaciones diferentes, y que la mayoría de la metodología de evaluación actual las confunde.

Vale la pena seguirlo cuando
se quiere alguien que trate las explicaciones generadas por LLM con el mismo escepticismo aplicado a las propias respuestas.
Temas
fidelidad (a la fuente) de explicaciones generadas y cadenas de razonamiento; límites de la interpretabilidad post hoc del modelo; NLP como campo: su historia y sus confusiones actuales.
Obras clave
Neural Network Methods for NLP (2017); publicaciones en curso sobre fidelidad (a la fuente) en NLG; comentario público sobre NLP como trayectoria más amplia.