Longpre koordiniert die Data Provenance Initiative, ein kollektives Audit der Lizenzierung, Herkunft und des Rechtsstatus der Datensätze hinter modernen LLMs. Das Projekt beantwortet eine Frage, die sich als viel schwieriger erweist, als sie klingt: Wenn ein Modell einen Satz produziert, welche Beweiskette zeigt dann, dass die Bausteine dieses Satzes überhaupt in seinem Trainingssatz waren? Seine frühere Arbeit am FLAN-Datensatz half, die Instruction-Tuning-Ära anzustoßen; der aktuelle Fokus liegt näher an ai100s Transparenzlinie — zu wissen, was einer Antwort vorgelagert ist, nicht nur, wie die Antwort aussieht.

Lesenswert, wenn
man belastbare Aussagen darüber machen muss, was ein Modell „weiß“ oder „womit es trainiert wurde“ — aus rechtlichen, Audit- oder Produktpositionierungsgründen.
Themen
Datensatzlizenzierung und Provenienz; der Datenlebenszyklus generativer Modelle; was ein echter Transparenzbericht über Trainingskorpora enthalten sollte.
Zentrale Arbeiten
Data Provenance Initiative (2023, laufend, Leitung); FLAN-Datensatzbeiträge (2021); Audit-Berichte zu Änderungen der Trainingsdatenlizenzierung (2024, laufend).