HELM est issu de son groupe à Stanford — ce que le monde académique a de plus proche d'un tableau de référence public et contestable pour les modèles de langage. Le choix qui définit ce travail est que les fonctions de notation (scoring), les jeux de données et les modèles de prompt sont tous ouverts, de sorte que l'on peut contester la méthodologie dans le détail. Cette posture — la méthodologie comme artefact, et non comme échafaudage autour d'un chiffre — est précisément ce dont la notation (scoring) propre à ai100 tente d'hériter.

À lire lorsque
vous voulez lire une évaluation produite par quelqu'un qui traite le comment de la notation (scoring) comme la contribution elle-même.
Thèmes
évaluation holistique des LLM; tests comportementaux des modèles de fondation; ce que les benchmarks incitent à faire et ce qu'ils masquent.
Travaux clés
HELM (2022, en cours); benchmark SQuAD de compréhension en lecture (2016, co-auteur); Foundation Model Transparency Index (2023, co-auteur).