Yonatan Belinkov
Что на самом деле находится в скрытых представлениях языковой модели — и какие из этих внутренних состояний соответствуют тому, что человек назвал бы знанием.
Задолго до того, как механистическая интерпретируемость стала мейнстримной подобластью, Belinkov проводил probing-эксперименты на нейронных языковых моделях: обучал небольшие классификаторы предсказывать, кодируют ли скрытые состояния модели часть речи, синтаксическую структуру, семантическую роль, фактологическое знание. Ранние результаты были отрезвляющими и стабилизирующими: модели часто действительно кодировали лингвистическую структуру измеримым образом, но кодирование было распределённым и спутанным, в паттернах, которые противоречили предположению, будто один слой или один нейрон «представляет» один концепт. Эта линия продолжается в его нынешней работе эпохи LLM, где вопрос в том, масштабируются ли те же probing-техники на модели в тысячу раз большего размера.