Задолго до того, как механистическая интерпретируемость стала мейнстримной подобластью, Belinkov проводил probing-эксперименты на нейронных языковых моделях: обучал небольшие классификаторы предсказывать, кодируют ли скрытые состояния модели часть речи, синтаксическую структуру, семантическую роль, фактологическое знание. Ранние результаты были отрезвляющими и стабилизирующими: модели часто действительно кодировали лингвистическую структуру измеримым образом, но кодирование было распределённым и спутанным, в паттернах, которые противоречили предположению, будто один слой или один нейрон «представляет» один концепт. Эта линия продолжается в его нынешней работе эпохи LLM, где вопрос в том, масштабируются ли те же probing-техники на модели в тысячу раз большего размера.

Стоит читать, когда
вы хотите заземлять утверждения о том, что языковая модель «знает», в чём-то более измеримом, чем её внешнее поведение.
Темы
probing-классификаторы для лингвистического и фактологического знания в LM; структура распределённых внутренних представлений; традиция BlackboxNLP.
Ключевые работы
основополагающие probing-эксперименты на нейронных LM (с 2017 года); "Linguistic Knowledge and Transferability of Contextual Representations" (2019, соавтор); сооснование серии воркшопов BlackboxNLP.