La mayoría de las discusiones sobre datos de entrenamiento de LLM ocurren a nivel de titular: «entrenado en la web», «entrenado en Common Crawl». El trabajo de Lo sobre Dolma, el corpus detrás de OLMo, muestra cómo se ve esa conversación cuando alguien realmente abre el archivo: decisiones documentadas sobre qué instantáneas de CommonCrawl, qué umbrales de deduplicación, qué heurísticas de filtrado, qué tipos de documentos, todo escrito con el nivel de detalle que un laboratorio comercial llamaría confidencial. SciBERT, antes en su carrera, hizo el movimiento equivalente para el texto científico: incorporar tokenización específica de dominio y preentrenamiento a partir de corpus documentados, y luego publicar el artefacto para que otros pudieran replicarlo.

Vale la pena seguirlo cuando
se quiere entender qué hay dentro de un corpus de entrenamiento con la granularidad necesaria para predecir el comportamiento aguas abajo del modelo, no al nivel de un resumen de marketing.
Temas
corpus abiertos de entrenamiento y su documentación (Dolma); preentrenamiento específico de dominio (SciBERT); estándares de documentación que distinguen el desarrollo de modelos abiertos del cerrado.
Obras clave
corpus abierto de entrenamiento Dolma (2024, líder); modelo de lenguaje abierto OLMo (2024, colíder); SciBERT (2019, líder).