Статья 2019 года "The Curious Case of Neural Text Degeneration", которую возглавил Holtzman, ввела nucleus sampling (top-p): вместо того чтобы сэмплировать следующий токен из полного распределения или из top-k токенов с наибольшей вероятностью, нужно сэмплировать из минимального множества токенов, чья суммарная вероятность превышает p. Метод стал стандартом почти для каждой развёрнутой LLM, включая те, которые сейчас оценивает ai100, потому что давал более естественный и менее повторяющийся текст, чем альтернативы. Следствие для оценки, которое область усваивает медленнее: два запуска одной и той же модели с разными настройками сэмплирования могут дать заметно разные баллы. Значит, результаты оценки говорят не только о модели — они отчасти говорят о том, какую конфигурацию декодирования использовал оценщик.

Стоит читать, когда
вы хотите понять решения на стороне генерации, которые влияют на то, что на самом деле измеряет оценка LLM, помимо параметрического состояния модели.
Темы
nucleus sampling и top-p decoding; влияние стратегии декодирования на результаты оценки LLM; теория и методология генерации текста.
Ключевые работы
"The Curious Case of Neural Text Degeneration", где введён nucleus sampling (2019, ведущий автор); текущие публикации по оценке генерации текста; UChicago Conceptualization Lab.