Ari Holtzman
Cómo generan texto realmente los modelos de lenguaje a partir de sus distribuciones de probabilidad, y qué efecto tiene la elección del método de muestreo sobre los resultados de evaluación.
El artículo de 2019 "The Curious Case of Neural Text Degeneration", liderado por Holtzman, introdujo el muestreo nucleus (top-p): en lugar de muestrear el siguiente token desde la distribución completa o desde los top-k tokens de mayor probabilidad, se muestrea desde el conjunto más pequeño de tokens cuya probabilidad acumulada supera p. El método se convirtió en el estándar para casi todos los LLM desplegados, incluidos los que ai100 evalúa actualmente, porque producía texto más fluido y menos repetitivo que las alternativas. La implicación para la evaluación, que el campo ha tardado más en absorber: dos ejecuciones del mismo modelo con configuraciones de muestreo distintas pueden producir puntuaciones notablemente diferentes, lo que significa que los resultados de evaluación no tratan solo del modelo; también dependen, en parte, de qué configuración de decodificación haya usado el evaluador.