Mengnan Du
Какие объяснения можно получить для выходов языковой модели — и какие из этих объяснений оказываются надёжными.
Литература об объяснении отдельных выходов LLM росла быстрее, чем методы валидации этих объяснений относительно эталона. Обзор Du "Explainability for Large Language Models: A Survey" (2024, старший автор с коллегами) раскладывает этот ландшафт по категориям, которые стали существенными: методы на основе внимания, градиентов, возмущений и объяснения на естественном языке, которые модель генерирует о самой себе, — у каждой категории есть задокументированные сильные стороны и хорошо задокументированные режимы отказа. Обзор особенно полезен там, где большинство других обзоров молчит: в разборе по случаям, когда метод объяснения не просто недоинформирует, а активно вводит в заблуждение.