Choi ist die konsequenteste Stimme im NLP, die argumentiert, dass Skalierung allein kein Common-Sense-Reasoning hervorbringt, und ihre Gruppe hat die Benchmarks gebaut, um das zu zeigen: HellaSwag (wo Menschen 95 % richtig lösen und Sprachmodelle von 2019 auf 47 % kamen), PIQA für physikalischen Common Sense, SIQA für sozialen, COMET für Common-Sense-Wissensgraphen. Das Framing, das sie ins Feld brachte — dass aktuelle Evaluation Modellen Anerkennung für Oberflächenmuster-Abgleich in Aufgaben gibt, bei denen Menschen tatsächliche Weltmodelle nutzen — ist gut gealtert: Größere LLMs verbesserten sich auf den Benchmarks, während sie weiterhin Reasoning-Fehler produzierten, die diese Benchmarks eigentlich sichtbar machen sollten. Für ai100 ist das die Literatur, die unsere Skepsis gegenüber Benchmark-Schlagzeilenzahlen begründet: Ein Modell, das 92 % auf Common-Sense-Benchmarks erzielt, kann immer noch etwas anderes tun als Menschen, die 95 % erreichen, und dieser Unterschied zählt für nachgelagertes Verhalten.

Lesenswert, wenn
man LLM-Bewertungsmethodik will, die in der Lücke zwischen Benchmark-Performance und tatsächlicher Kompetenz im logischen Schließen (Reasoning) verankert ist — von jemandem, der dieses Argument schon vertreten hat, bevor es Mode wurde.
Themen
Evaluation von Common-Sense-Reasoning (HellaSwag, PIQA, SIQA, COMET); die methodische Lücke zwischen Benchmark-Scores und Kompetenz im logischen Schließen (Reasoning); langjährige Arbeit dazu, was NLP-Evaluation tatsächlich misst.
Zentrale Arbeiten
HellaSwag (2019, Seniorautorin); PIQA: Reasoning about Physical Commonsense (2020, Mitautorin); COMET: Commonsense Transformers for Automatic Knowledge Graph Construction (2019, Seniorautorin); Defending Against Neural Fake News (Grover, 2019, Seniorautorin); Werkkomplex des AI2 Mosaic Team zu Common-Sense AI.