Kyle Lo
Was tatsächlich in einem Trainingskorpus steckt, wenn man sich hinsetzt und ihn Dokument für Dokument ansieht.
Die meiste Diskussion über LLM-Trainingsdaten findet auf Schlagwortebene statt — „auf dem Web trainiert“, „auf Common Crawl trainiert“. Los Arbeit an Dolma, dem Korpus hinter OLMo, zeigt, wie dieses Gespräch aussieht, wenn jemand die Datei tatsächlich öffnet: dokumentierte Entscheidungen darüber, welche CommonCrawl-Snapshots, welche Deduplikationsschwellen, welche Filterheuristiken, welche Dokumenttypen — alles auf einem Detailniveau ausgeschrieben, das ein kommerzielles Labor vertraulich nennen würde. SciBERT, früher in seiner Karriere, vollzog dieselbe Bewegung für wissenschaftliche Texte — domänenspezifische Tokenisierung und Vortraining (Pretraining) aus dokumentierten Korpora einbauen und dann das Artefakt veröffentlichen, damit andere es replizieren können.