La literatura sobre explicar salidas individuales de LLM creció más rápido que los métodos para validar esas explicaciones contra una verdad de referencia. La revisión de Du "Explainability for Large Language Models: A Survey" (2024, autor sénior con colaboradores) ordena ese paisaje en categorías que han llegado a importar: explicaciones basadas en atención, basadas en gradientes, basadas en perturbaciones y explicaciones en lenguaje natural que el modelo genera sobre sí mismo, cada una con fortalezas documentadas y modos de fallo igualmente documentados. La revisión es especialmente útil en la parte que la mayoría de los demás omite: la discusión caso por caso de cuándo un método de explicación induce activamente a error en lugar de quedarse corto en información.

Vale la pena seguirlo cuando
se necesita elegir un método de explicabilidad para un LLM y se quiere saber cuáles de las opciones han sido validadas de forma independiente.
Temas
taxonomía de métodos de explicabilidad para LLM; autoexplicaciones de LLM y su fiabilidad; la brecha metodológica entre proponer explicaciones y validarlas.
Obras clave
"Explainability for Large Language Models: A Survey" (2024, autor sénior); publicaciones en curso de TMLR Lab sobre LLM fiables y explicables.