Choi ha sido la voz más constante en NLP al argumentar que la escala por sí sola no produce razonamiento de sentido común, y su grupo ha construido los benchmarks para demostrarlo: HellaSwag (donde los humanos aciertan el 95% y los modelos de lenguaje de 2019 lograban el 47%), PIQA para sentido común físico, SIQA para lo social, COMET para grafos de conocimiento de sentido común. El encuadre que llevó al campo —que la evaluación actual concede crédito a los modelos por emparejar patrones superficiales en tareas donde los humanos usan modelos reales del mundo— ha envejecido bien a medida que LLM más grandes mejoraron en los benchmarks sin dejar de producir los fallos de razonamiento que esos benchmarks estaban diseñados para exponer. Para ai100, esta es la literatura que justifica nuestro escepticismo ante las cifras principales de benchmark: un modelo que puntúa 92% en benchmarks de sentido común aún puede estar haciendo algo distinto de lo que hacen los humanos para puntuar 95%, y esa diferencia importa para el comportamiento aguas abajo.

Vale la pena seguirlo cuando
se quiere metodología de evaluación de LLM anclada en la brecha entre rendimiento en benchmark y competencia real de razonamiento, de alguien que viene planteando ese argumento desde antes de que estuviera de moda.
Temas
evaluación de razonamiento de sentido común (HellaSwag, PIQA, SIQA, COMET); brecha metodológica entre puntuaciones de benchmark y competencia de razonamiento; trabajo de largo arco sobre lo que realmente mide la evaluación de NLP.
Obras clave
HellaSwag (2019, autora sénior); PIQA: Reasoning about Physical Commonsense (2020, coautora); COMET: Commonsense Transformers for Automatic Knowledge Graph Construction (2019, autora sénior); Defending Against Neural Fake News (Grover, 2019, autora sénior); trayectoria de trabajo del AI2 Mosaic Team sobre IA de sentido común.