Yejin Choi
Was nötig wäre, damit ein Sprachmodell das besitzt, was Menschen im Überfluss haben und was LLMs zuverlässig fehlt — gesunden Menschenverstand.
Choi ist die konsequenteste Stimme im NLP, die argumentiert, dass Skalierung allein kein Common-Sense-Reasoning hervorbringt, und ihre Gruppe hat die Benchmarks gebaut, um das zu zeigen: HellaSwag (wo Menschen 95 % richtig lösen und Sprachmodelle von 2019 auf 47 % kamen), PIQA für physikalischen Common Sense, SIQA für sozialen, COMET für Common-Sense-Wissensgraphen. Das Framing, das sie ins Feld brachte — dass aktuelle Evaluation Modellen Anerkennung für Oberflächenmuster-Abgleich in Aufgaben gibt, bei denen Menschen tatsächliche Weltmodelle nutzen — ist gut gealtert: Größere LLMs verbesserten sich auf den Benchmarks, während sie weiterhin Reasoning-Fehler produzierten, die diese Benchmarks eigentlich sichtbar machen sollten. Für ai100 ist das die Literatur, die unsere Skepsis gegenüber Benchmark-Schlagzeilenzahlen begründet: Ein Modell, das 92 % auf Common-Sense-Benchmarks erzielt, kann immer noch etwas anderes tun als Menschen, die 95 % erreichen, und dieser Unterschied zählt für nachgelagertes Verhalten.