Potts aborda los modelos de lenguaje desde una formación en lingüística y filosofía, lo que le da un ángulo inusual sobre lo que la metodología de evaluación actual nos permite concluir. Stanford Sentiment Treebank, que su grupo co-construyó hace más de una década, sigue siendo citado en casi todos los artículos sobre clasificación de sentimiento: en parte por el conjunto de datos en sí, en parte porque hizo de la estructura composicional, y no de la polaridad de palabras, la unidad de evaluación. Su trabajo más reciente en benchmarks adversariales dinámicos como DynaSent sostiene un punto más silencioso: un conjunto de prueba estático se vuelve obsoleto en el momento en que aparece, porque los modelos posteriores entrenan sobre su eco en el corpus.

Vale la pena seguirlo cuando
se quiere la lectura de un lingüista sobre lo que un resultado de benchmark de LLM permite afirmar y lo que no.
Temas
sentimiento e inferencia de lenguaje natural como casos de prueba para significado composicional; diseño de benchmarks adversariales y dinámicos; la lingüística detrás de la evaluación de LLM.
Obras clave
Stanford Sentiment Treebank (2013, coautor); benchmark dinámico DynaSent (2021); trabajo en curso sobre pruebas de generalización composicional para LLM.