Ari Holtzman
Как языковые модели на самом деле генерируют текст из своих вероятностных распределений — и что выбор метода сэмплирования делает с результатами оценки.
Статья 2019 года "The Curious Case of Neural Text Degeneration", которую возглавил Holtzman, ввела nucleus sampling (top-p): вместо того чтобы сэмплировать следующий токен из полного распределения или из top-k токенов с наибольшей вероятностью, нужно сэмплировать из минимального множества токенов, чья суммарная вероятность превышает p. Метод стал стандартом почти для каждой развёрнутой LLM, включая те, которые сейчас оценивает ai100, потому что давал более естественный и менее повторяющийся текст, чем альтернативы. Следствие для оценки, которое область усваивает медленнее: два запуска одной и той же модели с разными настройками сэмплирования могут дать заметно разные баллы. Значит, результаты оценки говорят не только о модели — они отчасти говорят о том, какую конфигурацию декодирования использовал оценщик.