Mucho antes de que la interpretabilidad mecanicista se convirtiera en un subcampo mainstream, Belinkov ya realizaba experimentos de sondeo en modelos de lenguaje neuronales: entrenaba pequeños clasificadores para predecir si los estados ocultos del modelo codifican categorías gramaticales, estructura sintáctica, rol semántico o conocimiento factual. Los primeros resultados fueron aleccionadores y estabilizadores: los modelos a menudo sí codificaban estructura lingüística de maneras medibles, pero la codificación era distribuida y enmarañada en patrones que contradecían la suposición de que una sola capa o unidad «representa» un único concepto. La línea continúa en su trabajo actual de la era LLM, donde la pregunta es si las mismas técnicas de sondeo escalan a modelos mil veces mayores.

Vale la pena seguirlo cuando
se quiere anclar afirmaciones sobre lo que un modelo de lenguaje «sabe» en algo más medible que su comportamiento de salida.
Temas
clasificadores de sondeo para conocimiento lingüístico y factual en LM; estructura de representaciones internas distribuidas; tradición BlackboxNLP.
Obras clave
experimentos fundacionales de sondeo en LM neuronales (2017 en adelante); "Linguistic Knowledge and Transferability of Contextual Representations" (2019, coautor); cofundación de la serie de workshops BlackboxNLP.