Marco Baroni
Si los modelos de lenguaje neuronales pueden componer lo aprendido en combinaciones nuevas que nunca han visto — o si en realidad solo hacen una interpolación sofisticada dentro de su distribución de entrenamiento.
El grupo de Baroni construyó SCAN (2018) como una prueba controlada de generalización composicional: un pequeño lenguaje sintético en el que el modelo debe combinar verbos y modificadores en patrones ausentes del entrenamiento. Los modelos sequence-to-sequence neuronales, incluso entonces la arquitectura dominante, fracasaron de manera espectacular: generalizaban una combinación breve reservada, pero se rompían con otras apenas más largas. El resultado se generalizó: artículos posteriores han mostrado los mismos fallos de generalización composicional en LLM modernos a escala, lo que significa que la pregunta que Baroni puso sobre la mesa en 2018 no ha sido respondida solo por la escala.