Большая часть публичной оценки LLM измеряет, что модель умеет делать. Foundation Model Transparency Index Bommasani, запущенный в Stanford CRFM, проходит по перпендикулярной оси: насколько много мы знаем о самой модели — что было в её обучающих данных, какие внутренние оценки проводились, какие последующие эффекты задокументированы, что раскрыто публично, а что оставлено закрытым. Базовый аргумент прямой: benchmark-и способностей мало что значат, когда условия, породившие эти способности, не зафиксированы в открытом виде; и только отношение к прозрачности как к отдельной исследовательской дисциплине, а не как к PR-задаче, делает сравнение честным.

Стоит читать, когда
вам нужно объяснить инвестору или партнёру, почему «у этой модели хорошие benchmark-баллы» и «эта модель прозрачна» — не один и тот же ответ.
Темы
методология Foundation Model Transparency Index; что должна содержать документация модели; разрыв между тем, что модельные лаборатории говорят, и тем, что они делают проверяемым.
Ключевые работы
Foundation Model Transparency Index (2023, продолжается, руководитель); отчёт "On the Opportunities and Risks of Foundation Models" (2021, соавтор); публикации Stanford CRFM по AI policy.