Bien avant que l'interprétabilité mécanistique ne devienne un sous-domaine central, Belinkov menait des expériences de sondage sur les modèles de langage neuronaux — entraîner de petits classifieurs pour prédire si les états cachés du modèle encodent la catégorie grammaticale, la structure syntaxique, le rôle sémantique, la connaissance factuelle. Les premiers résultats étaient à la fois sobres et stabilisants : les modèles encodaient souvent des structures linguistiques de manière mesurable, mais cet encodage était distribué et entremêlé dans des motifs qui contredisaient l'hypothèse selon laquelle une couche ou une unité unique « représente » un concept unique. Cette ligne se poursuit dans ses travaux actuels de l'ère LLM, où la question est de savoir si les mêmes techniques de sondage se transposent à des modèles mille fois plus grands.

À lire lorsque
vous voulez ancrer les affirmations sur ce qu'un modèle de langage « sait » dans quelque chose de plus mesurable que son comportement de sortie.
Thèmes
classifieurs de sondage pour les connaissances linguistiques et factuelles dans les modèles de langage; structure des représentations internes distribuées; tradition BlackboxNLP.
Travaux clés
expériences fondatrices de sondage sur les modèles de langage neuronaux (depuis 2017); "Linguistic Knowledge and Transferability of Contextual Representations" (2019, co-auteur); cofondation de la série d’ateliers BlackboxNLP.