Yonatan Belinkov
Was tatsächlich in den verborgenen Repräsentationen eines Sprachmodells steckt — und welche dieser internen Zustände auf Dinge abbilden, die Menschen als Wissen erkennen würden.
Lange bevor mechanistische Interpretierbarkeit zu einem Mainstream-Teilfeld wurde, führte Belinkov Probing-Experimente an neuronalen Sprachmodellen durch — er trainierte kleine Klassifikatoren darauf vorherzusagen, ob die verborgenen Zustände des Modells Wortart, syntaktische Struktur, semantische Rolle oder faktisches Wissen kodieren. Die frühen Ergebnisse waren ernüchternd und stabilisierend: Modelle kodierten linguistische Struktur oft auf messbare Weise, doch die Codierung war verteilt und verschränkt in Mustern, die der Annahme widersprachen, eine einzelne Schicht oder Einheit „repräsentiere“ ein einzelnes Konzept. Diese Linie setzt sich in seiner heutigen LLM-Ära-Arbeit fort, in der die Frage lautet, ob dieselben Probing-Techniken auf tausendfach größere Modelle skalieren.