Longpre coordina la Data Provenance Initiative, una auditoría colectiva de las licencias, la procedencia y el estatus legal de los conjuntos de datos detrás de los LLM modernos. El proyecto responde a una pregunta que resulta ser mucho más difícil de lo que parece: cuando un modelo produce una oración, ¿cuál es la cadena de evidencia de que los bloques constitutivos de esa oración estaban siquiera en su conjunto de entrenamiento? Su trabajo previo en el conjunto de datos FLAN ayudó a sembrar la era del ajuste por instrucciones; el foco actual está más cerca de la línea de transparencia de ai100: saber qué hay aguas arriba de una respuesta, no solo cómo se ve la respuesta.

Vale la pena seguirlo cuando
se necesitan afirmaciones defendibles sobre lo que un modelo «sabe» o «con qué fue entrenado» por razones legales, de auditoría o de posicionamiento de producto.
Temas
licenciamiento y procedencia de conjuntos de datos; ciclo de vida de los datos de modelos generativos; qué debería contener un verdadero informe de transparencia sobre corpus de entrenamiento.
Obras clave
Data Provenance Initiative (2023, en curso, líder); contribuciones al conjunto de datos FLAN (2021); informes de auditoría sobre cambios de licenciamiento de datos de entrenamiento (2024, en curso).