Ari Holtzman
Comment les modèles de langage génèrent réellement du texte à partir de leurs distributions de probabilité — et ce que le choix de la méthode d'échantillonnage fait aux résultats d'évaluation.
L'article de 2019 "The Curious Case of Neural Text Degeneration", dirigé par Holtzman, a introduit l'échantillonnage par noyau (top-p) : au lieu d'échantillonner le token suivant depuis la distribution complète, ou depuis les top-k tokens de plus forte probabilité, on échantillonne depuis le plus petit ensemble de tokens dont la probabilité cumulée dépasse p. La méthode est devenue le standard pour presque tous les LLM déployés, y compris ceux qu'ai100 évalue actuellement, parce qu'elle produisait un texte plus fluide et moins répétitif que les alternatives. L'implication pour l'évaluation, que le domaine a été plus lent à intégrer, est la suivante : deux exécutions du même modèle avec des paramètres d'échantillonnage différents peuvent produire des notes sensiblement différentes, ce qui signifie que les résultats d'évaluation ne portent pas seulement sur le modèle — ils portent aussi en partie sur la configuration de décodage que l'évaluateur a utilisée.