← Назад к списку
Shayne Longpre
Что на самом деле находится внутри данных, на которых обучаются языковые модели, — и кто может или не может это узнать.
Longpre координирует Data Provenance Initiative, коллективный аудит лицензирования, источников и юридического статуса датасетов, стоящих за современными LLM. Проект отвечает на вопрос, который оказывается гораздо труднее, чем звучит: когда модель производит предложение, какова цепочка свидетельств того, что строительные блоки этого предложения вообще были в её обучающем наборе? Его более ранняя работа над датасетом FLAN помогла запустить эпоху instruction-tuning; нынешний фокус ближе к линии прозрачности ai100 — знать, что стоит выше по цепочке ответа, а не только как сам ответ выглядит.