Mengnan Du
Quels types d'explications peut-on obtenir pour les sorties des modèles de langage — et lesquelles de ces explications s'avèrent fiables.
La littérature sur l'explication des sorties individuelles de LLM s'est développée plus vite que les méthodes permettant de valider ces explications par rapport à une vérité terrain. "Explainability for Large Language Models: A Survey" de Du (2024, auteur senior avec collaborateurs) classe ce paysage en catégories qui ont fini par compter — méthodes fondées sur l'attention, fondées sur les gradients, fondées sur les perturbations, et explications en langage naturel que le modèle produit à propos de lui-même, chacune avec des forces documentées et des modes d'échec tout aussi documentés. La synthèse est particulièrement utile dans la partie que la plupart des autres synthèses sautent : la discussion, cas par cas, des situations où une méthode d'explication induit activement en erreur au lieu de simplement sous-informer.