Rishi Bommasani
Что разработчики языковых моделей рассказывают и не рассказывают нам о собственных моделях — и как измерять это систематически.
Большая часть публичной оценки LLM измеряет, что модель умеет делать. Foundation Model Transparency Index Bommasani, запущенный в Stanford CRFM, проходит по перпендикулярной оси: насколько много мы знаем о самой модели — что было в её обучающих данных, какие внутренние оценки проводились, какие последующие эффекты задокументированы, что раскрыто публично, а что оставлено закрытым. Базовый аргумент прямой: benchmark-и способностей мало что значат, когда условия, породившие эти способности, не зафиксированы в открытом виде; и только отношение к прозрачности как к отдельной исследовательской дисциплине, а не как к PR-задаче, делает сравнение честным.