Die meiste Diskussion über LLM-Trainingsdaten findet auf Schlagwortebene statt — „auf dem Web trainiert“, „auf Common Crawl trainiert“. Los Arbeit an Dolma, dem Korpus hinter OLMo, zeigt, wie dieses Gespräch aussieht, wenn jemand die Datei tatsächlich öffnet: dokumentierte Entscheidungen darüber, welche CommonCrawl-Snapshots, welche Deduplikationsschwellen, welche Filterheuristiken, welche Dokumenttypen — alles auf einem Detailniveau ausgeschrieben, das ein kommerzielles Labor vertraulich nennen würde. SciBERT, früher in seiner Karriere, vollzog dieselbe Bewegung für wissenschaftliche Texte — domänenspezifische Tokenisierung und Vortraining (Pretraining) aus dokumentierten Korpora einbauen und dann das Artefakt veröffentlichen, damit andere es replizieren können.

Lesenswert, wenn
man verstehen will, was in einem Trainingskorpus mit der Granularität steckt, die nötig ist, um nachgelagertes Modellverhalten vorherzusagen — statt auf Marketing-Zusammenfassungsebene.
Themen
offene Trainingskorpora und ihre Dokumentation (Dolma); domänenspezifisches Vortraining (SciBERT); die Dokumentationsstandards, die offene von geschlossener Modellentwicklung unterscheiden.
Zentrale Arbeiten
Dolma open training corpus (2024, Hauptautor); OLMo open language model (2024, Ko-Leitung); SciBERT (2019, Hauptautor).