← Назад к списку
Percy Liang
Как измерять языковые модели так, чтобы измерение, сделанное сегодня, что-то значило и в следующем году.
HELM вышел из его группы в Stanford — это самое близкое, что есть у академической стороны к публичной, оспариваемой референсной таблице результатов для языковых моделей. Выбор, который определяет эту работу, в том, что функции оценивания, датасеты и шаблоны prompt открыты: с методологией можно спорить предметно, вплоть до деталей. Именно эту позицию — методология как сам артефакт, а не служебная обвязка вокруг числа — пытается унаследовать собственное оценивание ai100.