Longpre координирует Data Provenance Initiative, коллективный аудит лицензирования, источников и юридического статуса датасетов, стоящих за современными LLM. Проект отвечает на вопрос, который оказывается гораздо труднее, чем звучит: когда модель производит предложение, какова цепочка свидетельств того, что строительные блоки этого предложения вообще были в её обучающем наборе? Его более ранняя работа над датасетом FLAN помогла запустить эпоху instruction-tuning; нынешний фокус ближе к линии прозрачности ai100 — знать, что стоит выше по цепочке ответа, а не только как сам ответ выглядит.

Стоит читать, когда
вам нужно делать защищаемые утверждения о том, что модель «знает» или «на чём была обучена», по юридическим, аудиторским или причинам продуктового позиционирования.
Темы
лицензирование и происхождение датасетов; жизненный цикл данных генеративных моделей; что должен содержать настоящий отчёт о прозрачности обучающих корпусов.
Ключевые работы
Data Provenance Initiative (2023, продолжается, руководитель); вклады в датасет FLAN (2021); аудиторские отчёты об изменениях в лицензировании обучающих данных (2024, продолжается).