Emma Strubell
La question de savoir si le coût en calcul et en énergie de l'entraînement et du service des modèles de langage doit figurer dans le titre d'une évaluation, là où l'exactitude se trouve aujourd'hui seule.
L'article de Strubell de 2019, "Energy and Policy Considerations for Deep Learning in NLP", a mis des chiffres sur une chose que le domaine ignorait discrètement : l'entraînement d'un seul grand modèle de langage pouvait produire des émissions de CO2 comparables à celles de plusieurs voitures sur toute leur durée de vie, et l'écart entre les rapports d'exactitude des articles de recherche et le coût carbone de leur production se creusait à chaque nouvel état de l'art. Ce travail a recadré l'efficacité, d'un souci d'ingénierie appréciable mais optionnel, en une dimension d'évaluation qui devrait apparaître à côté de l'exactitude dans toute comparaison de modèles. Pour ai100, qui évalue des modèles dont le coût d'inférence varie de plusieurs ordres de grandeur, c'est le socle méthodologique pour traiter « bonne réponse » et « bonne réponse à quel coût » comme deux questions différentes.