← Zurück zur Liste
Shayne Longpre
Was tatsächlich in den Daten steckt, auf denen Sprachmodelle trainieren — und wer das erkennen kann oder nicht.
Longpre koordiniert die Data Provenance Initiative, ein kollektives Audit der Lizenzierung, Herkunft und des Rechtsstatus der Datensätze hinter modernen LLMs. Das Projekt beantwortet eine Frage, die sich als viel schwieriger erweist, als sie klingt: Wenn ein Modell einen Satz produziert, welche Beweiskette zeigt dann, dass die Bausteine dieses Satzes überhaupt in seinem Trainingssatz waren? Seine frühere Arbeit am FLAN-Datensatz half, die Instruction-Tuning-Ära anzustoßen; der aktuelle Fokus liegt näher an ai100s Transparenzlinie — zu wissen, was einer Antwort vorgelagert ist, nicht nur, wie die Antwort aussieht.