La littérature sur l'explication des sorties individuelles de LLM s'est développée plus vite que les méthodes permettant de valider ces explications par rapport à une vérité terrain. "Explainability for Large Language Models: A Survey" de Du (2024, auteur senior avec collaborateurs) classe ce paysage en catégories qui ont fini par compter — méthodes fondées sur l'attention, fondées sur les gradients, fondées sur les perturbations, et explications en langage naturel que le modèle produit à propos de lui-même, chacune avec des forces documentées et des modes d'échec tout aussi documentés. La synthèse est particulièrement utile dans la partie que la plupart des autres synthèses sautent : la discussion, cas par cas, des situations où une méthode d'explication induit activement en erreur au lieu de simplement sous-informer.

À lire lorsque
vous devez choisir une méthode d'explicabilité pour un LLM et voulez savoir lesquelles ont été validées indépendamment.
Thèmes
taxonomie des méthodes d'explicabilité des LLM; auto-explications par les LLM et leur fiabilité; écart méthodologique entre proposer et valider des explications.
Travaux clés
"Explainability for Large Language Models: A Survey" (2024, auteur senior); publications en cours du TMLR Lab sur les LLM dignes de confiance et explicables.