Yejin Choi
Qué haría falta para que un modelo de lenguaje tuviera lo que a los humanos les sobra y a los LLM les falta de forma fiable: sentido común.
Choi ha sido la voz más constante en NLP al argumentar que la escala por sí sola no produce razonamiento de sentido común, y su grupo ha construido los benchmarks para demostrarlo: HellaSwag (donde los humanos aciertan el 95% y los modelos de lenguaje de 2019 lograban el 47%), PIQA para sentido común físico, SIQA para lo social, COMET para grafos de conocimiento de sentido común. El encuadre que llevó al campo —que la evaluación actual concede crédito a los modelos por emparejar patrones superficiales en tareas donde los humanos usan modelos reales del mundo— ha envejecido bien a medida que LLM más grandes mejoraron en los benchmarks sin dejar de producir los fallos de razonamiento que esos benchmarks estaban diseñados para exponer. Para ai100, esta es la literatura que justifica nuestro escepticismo ante las cifras principales de benchmark: un modelo que puntúa 92% en benchmarks de sentido común aún puede estar haciendo algo distinto de lo que hacen los humanos para puntuar 95%, y esa diferencia importa para el comportamiento aguas abajo.