Shayne Longpre
Qué hay realmente dentro de los datos con los que entrenan los modelos de lenguaje, y quién puede o no puede saberlo.
Longpre coordina la Data Provenance Initiative, una auditoría colectiva de las licencias, la procedencia y el estatus legal de los conjuntos de datos detrás de los LLM modernos. El proyecto responde a una pregunta que resulta ser mucho más difícil de lo que parece: cuando un modelo produce una oración, ¿cuál es la cadena de evidencia de que los bloques constitutivos de esa oración estaban siquiera en su conjunto de entrenamiento? Su trabajo previo en el conjunto de datos FLAN ayudó a sembrar la era del ajuste por instrucciones; el foco actual está más cerca de la línea de transparencia de ai100: saber qué hay aguas arriba de una respuesta, no solo cómo se ve la respuesta.