Goldberg a écrit l'un des manuels NLP de référence pour l'ère neuronale (2017) et a consacré les années suivantes à pousser une question qui devient plus difficile à mesure que les modèles gagnent en capacité : l'explication qu'un LLM donne de sa réponse est-elle la cause réelle de cette réponse, ou un récit plausible produit après coup ? Ses travaux sur la fidélité (à la source) des explications générées rappellent constamment que « le modèle a dit pourquoi il a fait X » et « nous savons pourquoi le modèle a fait X » sont deux affirmations différentes, et que la plupart des méthodologies d'évaluation actuelles les confondent.

À lire lorsque
vous voulez quelqu'un qui traite les explications générées par les LLM avec le même scepticisme que les réponses elles-mêmes.
Thèmes
fidélité (à la source) des explications générées et des chaînes de raisonnement; limites de l'interprétabilité post-hoc des modèles; le NLP comme domaine — son histoire et ses confusions actuelles.
Travaux clés
Neural Network Methods for NLP (2017); publications en cours sur la fidélité (à la source) en NLG; commentaire public sur le NLP comme corpus de travaux plus long.