← Zurück zur Liste
Percy Liang
Wie man Sprachmodelle so misst, dass eine heute vorgenommene Messung auch im nächsten Jahr noch etwas bedeutet.
HELM entstand in seiner Gruppe an Stanford — das, was die akademische Seite einem öffentlichen, anfechtbaren Referenz-Scoreboard für Sprachmodelle am nächsten hat. Die Entscheidung, die diese Arbeit prägt, ist, dass Scoring-Funktionen, Datensätze und prompt-Templates vollständig offenliegen; man kann der Methodik also im Detail widersprechen. Diese Haltung — Methodik als eigentlicher Forschungsgegenstand, nicht als Gerüst um eine Zahl herum — ist das, was ai100 mit seinem eigenen Scoring zu übernehmen versucht.