Kyle Lo
Что на самом деле находится в обучающем корпусе, когда вы садитесь и смотрите на него документ за документом.
Большая часть обсуждений обучающих данных LLM происходит на уровне заголовков: «обучено на вебе», «обучено на Common Crawl». Работа Lo над Dolma, корпусом за OLMo, показывает, как этот разговор выглядит, когда кто-то действительно открывает файл: документированные решения о том, какие снимки CommonCrawl были взяты, какие пороги дедупликации использованы, какие эвристики фильтрации применены, какие типы документов включены, — и всё это описано на уровне детализации, который коммерческая лаборатория назвала бы конфиденциальным. SciBERT, ранее в его карьере, сделал эквивалентный ход для научного текста: встроить доменно-специфическую токенизацию и предобучение на задокументированных корпусах, а затем выпустить артефакт, чтобы другие могли воспроизвести результат.