Yonatan Belinkov
Qué hay realmente dentro de las representaciones ocultas de un modelo de lenguaje — y cuáles de esos estados internos se corresponden con cosas que los humanos reconocerían como conocimiento.
Mucho antes de que la interpretabilidad mecanicista se convirtiera en un subcampo mainstream, Belinkov ya realizaba experimentos de sondeo en modelos de lenguaje neuronales: entrenaba pequeños clasificadores para predecir si los estados ocultos del modelo codifican categorías gramaticales, estructura sintáctica, rol semántico o conocimiento factual. Los primeros resultados fueron aleccionadores y estabilizadores: los modelos a menudo sí codificaban estructura lingüística de maneras medibles, pero la codificación era distribuida y enmarañada en patrones que contradecían la suposición de que una sola capa o unidad «representa» un único concepto. La línea continúa en su trabajo actual de la era LLM, donde la pregunta es si las mismas técnicas de sondeo escalan a modelos mil veces mayores.