El grupo de Baroni construyó SCAN (2018) como una prueba controlada de generalización composicional: un pequeño lenguaje sintético en el que el modelo debe combinar verbos y modificadores en patrones ausentes del entrenamiento. Los modelos sequence-to-sequence neuronales, incluso entonces la arquitectura dominante, fracasaron de manera espectacular: generalizaban una combinación breve reservada, pero se rompían con otras apenas más largas. El resultado se generalizó: artículos posteriores han mostrado los mismos fallos de generalización composicional en LLM modernos a escala, lo que significa que la pregunta que Baroni puso sobre la mesa en 2018 no ha sido respondida solo por la escala.

Vale la pena seguirlo cuando
se necesita evaluar si el razonamiento de un modelo es genuinamente composicional o solo una forma sofisticada de ajuste a patrones dentro de la distribución.
Temas
benchmarks de generalización composicional (SCAN y sucesores); semántica distribucional desde un ángulo lingüístico; qué corrige y qué no corrige la escala de los LLM sobre brechas fundamentales de generalización.
Obras clave
benchmark SCAN de generalización composicional (2018, autor sénior); trayectoria extensa en semántica distribucional desde UPF Barcelona; publicaciones con premio ACL test-of-time.