Kyle Lo
Ce qu'il y a réellement dans un corpus d'entraînement lorsque l'on s'assoit pour l'examiner document par document.
La plupart des discussions sur les données d'entraînement des LLM restent au niveau des gros titres — « entraîné sur le web », « entraîné sur Common Crawl ». Les travaux de Lo sur Dolma, le corpus derrière OLMo, montrent à quoi ressemble cette conversation lorsque quelqu'un ouvre effectivement le fichier : décisions documentées sur les instantanés CommonCrawl retenus, les seuils de déduplication, les heuristiques de filtrage, les types de documents, le tout rédigé avec un niveau de détail qu'un laboratoire commercial qualifierait de confidentiel. SciBERT, plus tôt dans sa carrière, a accompli le même geste pour les textes scientifiques — intégrer une tokenisation et un pré-entraînement spécifiques au domaine à partir de corpus documentés, puis livrer l'artefact pour que d'autres puissent répliquer.