← Retour à la liste
Percy Liang
Comment mesurer les modèles de langage de sorte qu'une mesure faite aujourd'hui veuille encore dire quelque chose l'année prochaine.
HELM est issu de son groupe à Stanford — ce que le monde académique a de plus proche d'un tableau de référence public et contestable pour les modèles de langage. Le choix qui définit ce travail est que les fonctions de notation (scoring), les jeux de données et les modèles de prompt sont tous ouverts, de sorte que l'on peut contester la méthodologie dans le détail. Cette posture — la méthodologie comme artefact, et non comme échafaudage autour d'un chiffre — est précisément ce dont la notation (scoring) propre à ai100 tente d'hériter.