Литература об объяснении отдельных выходов LLM росла быстрее, чем методы валидации этих объяснений относительно эталона. Обзор Du "Explainability for Large Language Models: A Survey" (2024, старший автор с коллегами) раскладывает этот ландшафт по категориям, которые стали существенными: методы на основе внимания, градиентов, возмущений и объяснения на естественном языке, которые модель генерирует о самой себе, — у каждой категории есть задокументированные сильные стороны и хорошо задокументированные режимы отказа. Обзор особенно полезен там, где большинство других обзоров молчит: в разборе по случаям, когда метод объяснения не просто недоинформирует, а активно вводит в заблуждение.

Стоит читать, когда
вам нужно выбрать метод объяснимости для LLM и понять, какие варианты были независимо валидированы.
Темы
таксономия методов объяснимости LLM; самообъяснения LLM и их надёжность; методологический разрыв между предложением и валидацией объяснений.
Ключевые работы
"Explainability for Large Language Models: A Survey" (2024, старший автор); продолжающиеся публикации TMLR Lab по надёжным и объяснимым LLM.