La plupart des discussions sur les données d'entraînement des LLM restent au niveau des gros titres — « entraîné sur le web », « entraîné sur Common Crawl ». Les travaux de Lo sur Dolma, le corpus derrière OLMo, montrent à quoi ressemble cette conversation lorsque quelqu'un ouvre effectivement le fichier : décisions documentées sur les instantanés CommonCrawl retenus, les seuils de déduplication, les heuristiques de filtrage, les types de documents, le tout rédigé avec un niveau de détail qu'un laboratoire commercial qualifierait de confidentiel. SciBERT, plus tôt dans sa carrière, a accompli le même geste pour les textes scientifiques — intégrer une tokenisation et un pré-entraînement spécifiques au domaine à partir de corpus documentés, puis livrer l'artefact pour que d'autres puissent répliquer.

À lire lorsque
vous voulez comprendre ce qu'il y a dans un corpus d'entraînement avec la granularité nécessaire pour prédire le comportement aval du modèle — plutôt qu'au niveau d'un résumé marketing.
Thèmes
corpus d'entraînement ouverts et leur documentation (Dolma); pré-entraînement spécifique au domaine (SciBERT); normes de documentation qui distinguent le développement ouvert du développement fermé de modèles.
Travaux clés
corpus d'entraînement ouvert Dolma (2024, direction); modèle de langage ouvert OLMo (2024, codirection); SciBERT (2019, direction).