HELM вышел из его группы в Stanford — это самое близкое, что есть у академической стороны к публичной, оспариваемой референсной таблице результатов для языковых моделей. Выбор, который определяет эту работу, в том, что функции оценивания, датасеты и шаблоны prompt открыты: с методологией можно спорить предметно, вплоть до деталей. Именно эту позицию — методология как сам артефакт, а не служебная обвязка вокруг числа — пытается унаследовать собственное оценивание ai100.

Стоит читать, когда
вы хотите читать оценку, сделанную человеком, для которого как именно устроено оценивание — это и есть вклад.
Темы
целостная оценка LLM; поведенческое тестирование фундаментальных моделей; что стимулируют benchmark и что они скрывают.
Ключевые работы
HELM (2022, продолжается); SQuAD reading-comprehension benchmark (2016, соавтор); Foundation Model Transparency Index (2023, соавтор).