Goldberg написал один из стандартных учебников NLP нейронной эпохи (2017) и последние годы настойчиво разбирает вопрос, который становится всё труднее по мере роста возможностей моделей: объяснение, которое LLM даёт своему ответу, — это реальная причина этого ответа или правдоподобная история, сгенерированная постфактум? Его работы о верности генерируемых объяснений реальному ходу вывода постоянно напоминают: «модель сказала, почему она сделала X» и «мы знаем, почему модель сделала X» — это разные утверждения, а большая часть нынешней методологии оценки их смешивает.

Стоит читать, когда
вам нужен исследователь, который относится к объяснениям, генерируемым LLM, с тем же скепсисом, что и к самим ответам.
Темы
верность сгенерированных объяснений и цепочек рассуждений; пределы постфактумной интерпретируемости моделей; NLP как область — её история и нынешние зоны путаницы.
Ключевые работы
Neural Network Methods for NLP (2017); продолжающиеся публикации о верности объяснений в NLG; публичные комментарии о NLP как самостоятельная большая линия работ.