Большая часть обсуждений обучающих данных LLM происходит на уровне заголовков: «обучено на вебе», «обучено на Common Crawl». Работа Lo над Dolma, корпусом за OLMo, показывает, как этот разговор выглядит, когда кто-то действительно открывает файл: документированные решения о том, какие снимки CommonCrawl были взяты, какие пороги дедупликации использованы, какие эвристики фильтрации применены, какие типы документов включены, — и всё это описано на уровне детализации, который коммерческая лаборатория назвала бы конфиденциальным. SciBERT, ранее в его карьере, сделал эквивалентный ход для научного текста: встроить доменно-специфическую токенизацию и предобучение на задокументированных корпусах, а затем выпустить артефакт, чтобы другие могли воспроизвести результат.

Стоит читать, когда
вы хотите понять, что находится внутри обучающего корпуса, на той гранулярности, которая нужна для предсказания последующего поведения модели, — а не на уровне маркетингового резюме.
Темы
открытые обучающие корпуса и их документация (Dolma); доменно-специфическое предобучение (SciBERT); стандарты документации, которые отличают открытую разработку моделей от закрытой.
Ключевые работы
открытый обучающий корпус Dolma (2024, ведущий автор); открытая языковая модель OLMo (2024, соруководитель); SciBERT (2019, ведущий автор).