Kyle Lo
Qué hay realmente en un corpus de entrenamiento cuando uno se sienta a mirarlo documento por documento.
La mayoría de las discusiones sobre datos de entrenamiento de LLM ocurren a nivel de titular: «entrenado en la web», «entrenado en Common Crawl». El trabajo de Lo sobre Dolma, el corpus detrás de OLMo, muestra cómo se ve esa conversación cuando alguien realmente abre el archivo: decisiones documentadas sobre qué instantáneas de CommonCrawl, qué umbrales de deduplicación, qué heurísticas de filtrado, qué tipos de documentos, todo escrito con el nivel de detalle que un laboratorio comercial llamaría confidencial. SciBERT, antes en su carrera, hizo el movimiento equivalente para el texto científico: incorporar tokenización específica de dominio y preentrenamiento a partir de corpus documentados, y luego publicar el artefacto para que otros pudieran replicarlo.