Mengnan Du
Qué tipos de explicaciones pueden obtenerse para las salidas de modelos de lenguaje, y cuáles de esas explicaciones resultan ser fiables.
La literatura sobre explicar salidas individuales de LLM creció más rápido que los métodos para validar esas explicaciones contra una verdad de referencia. La revisión de Du "Explainability for Large Language Models: A Survey" (2024, autor sénior con colaboradores) ordena ese paisaje en categorías que han llegado a importar: explicaciones basadas en atención, basadas en gradientes, basadas en perturbaciones y explicaciones en lenguaje natural que el modelo genera sobre sí mismo, cada una con fortalezas documentadas y modos de fallo igualmente documentados. La revisión es especialmente útil en la parte que la mayoría de los demás omite: la discusión caso por caso de cuándo un método de explicación induce activamente a error en lugar de quedarse corto en información.