Rishi Bommasani
Was Entwickler von Sprachmodellen über ihre eigenen Modelle mitteilen und was nicht — und wie man das systematisch misst.
Die meiste öffentliche LLM-Evaluation misst, was ein Modell kann. Bommasanis Foundation Model Transparency Index, betrieben aus Stanford CRFM heraus, verläuft auf einer orthogonalen Achse: Wie viel wissen wir über das Modell selbst — was in seinen Trainingsdaten war, welche internen Evaluationen durchgeführt wurden, welche nachgelagerten Auswirkungen dokumentiert sind, was öffentlich offengelegt wurde und was privat gehalten wird. Das zugrunde liegende Argument ist direkt: Fähigkeits-Benchmarks bedeuten wenig, wenn die Bedingungen, die diese Fähigkeiten hervorgebracht haben, nicht aktenkundig sind, und Transparenz als eigene Forschungsdisziplin zu behandeln (statt als PR-Anliegen) ist der einzige Weg, wie der Vergleich ehrlich wird.