El artículo de 2019 "The Curious Case of Neural Text Degeneration", liderado por Holtzman, introdujo el muestreo nucleus (top-p): en lugar de muestrear el siguiente token desde la distribución completa o desde los top-k tokens de mayor probabilidad, se muestrea desde el conjunto más pequeño de tokens cuya probabilidad acumulada supera p. El método se convirtió en el estándar para casi todos los LLM desplegados, incluidos los que ai100 evalúa actualmente, porque producía texto más fluido y menos repetitivo que las alternativas. La implicación para la evaluación, que el campo ha tardado más en absorber: dos ejecuciones del mismo modelo con configuraciones de muestreo distintas pueden producir puntuaciones notablemente diferentes, lo que significa que los resultados de evaluación no tratan solo del modelo; también dependen, en parte, de qué configuración de decodificación haya usado el evaluador.

Vale la pena seguirlo cuando
se quiere entender las decisiones del lado de la generación que afectan a lo que realmente mide una evaluación de LLM, más allá del estado paramétrico del modelo.
Temas
muestreo nucleus y decodificación top-p; influencia de la estrategia de decodificación en los resultados de evaluación de LLM; teoría y metodología de generación de texto.
Obras clave
"The Curious Case of Neural Text Degeneration" que introduce el muestreo nucleus (2019, autor principal); publicaciones en curso sobre evaluación de generación de texto; UChicago Conceptualization Lab.