Yonatan Belinkov
Ce qui se trouve réellement dans les représentations cachées d'un modèle de langage — et lesquels de ces états internes correspondent à des choses qu'un humain reconnaîtrait comme du savoir.
Bien avant que l'interprétabilité mécanistique ne devienne un sous-domaine central, Belinkov menait des expériences de sondage sur les modèles de langage neuronaux — entraîner de petits classifieurs pour prédire si les états cachés du modèle encodent la catégorie grammaticale, la structure syntaxique, le rôle sémantique, la connaissance factuelle. Les premiers résultats étaient à la fois sobres et stabilisants : les modèles encodaient souvent des structures linguistiques de manière mesurable, mais cet encodage était distribué et entremêlé dans des motifs qui contredisaient l'hypothèse selon laquelle une couche ou une unité unique « représente » un concept unique. Cette ligne se poursuit dans ses travaux actuels de l'ère LLM, où la question est de savoir si les mêmes techniques de sondage se transposent à des modèles mille fois plus grands.