Jared Kaplan
Savoir si la perte d'un modèle de langage est une fonction régulière du calcul, des données et de la taille du modèle — et ce que cette régularité permet de prédire, ou non, sur les capacités à plus grande échelle.
Kaplan a dirigé "Scaling Laws for Neural Language Models" (2020, auteur principal avec des collaborateurs d'OpenAI), l'article qui a formalisé ce que le domaine observait empiriquement : la perte d'entraînement des LLM suit une loi de puissance propre en fonction du calcul, des paramètres et de la taille du jeu de données, avec des exposants prévisibles. Le résultat est devenu l'instrument de planification de chaque entraînement ultérieur à grande échelle — si vous connaissez la courbe de perte, vous pouvez budgéter calcul et données pour atteindre une performance cible avec peu de surprises. La limite méthodologique, que l'article lui-même prenait soin de signaler et que le domaine a depuis redécouverte à ses dépens, est que la mise à l'échelle régulière de la perte ne se traduit pas proprement en mise à l'échelle régulière d'une capacité particulière — les discontinuités de capacités émergentes vivent dans l'écart entre perte agrégée et évaluation au niveau de la tâche.