HELM entstand in seiner Gruppe an Stanford — das, was die akademische Seite einem öffentlichen, anfechtbaren Referenz-Scoreboard für Sprachmodelle am nächsten hat. Die Entscheidung, die diese Arbeit prägt, ist, dass Scoring-Funktionen, Datensätze und prompt-Templates vollständig offenliegen; man kann der Methodik also im Detail widersprechen. Diese Haltung — Methodik als eigentlicher Forschungsgegenstand, nicht als Gerüst um eine Zahl herum — ist das, was ai100 mit seinem eigenen Scoring zu übernehmen versucht.

Lesenswert, wenn
man Evaluation lesen will, bei der jemand das Wie des Scorings selbst als Beitrag behandelt.
Themen
holistische LLM-Evaluation; verhaltensorientiertes Testen von Foundation-Models; was benchmarks anreizen und was sie verdecken.
Zentrale Arbeiten
HELM (2022, laufend); SQuAD reading-comprehension benchmark (2016, Mitautor); Foundation Model Transparency Index (2023, Mitautor).