Potts подходит к языковым моделям из лингвистики и философии, что даёт ему необычный угол зрения на то, какие выводы позволяет делать текущая методология оценки. Stanford Sentiment Treebank, который его группа помогла построить более десяти лет назад, до сих пор цитируется почти в каждой статье о классификации тональности — отчасти из-за самого датасета, отчасти потому, что он сделал единицей оценки композиционную структуру, а не полярность слов. Его более поздняя работа над динамическими состязательными benchmark-ами вроде DynaSent проводит более тихий тезис: статичная тестовая выборка устаревает в момент появления, потому что последующие модели обучаются на её эхе в корпусе.

Стоит читать, когда
вам нужен взгляд лингвиста на то, что результат LLM на benchmark позволяет и не позволяет утверждать.
Темы
тональность и natural language inference (NLI) как тестовые случаи композиционного смысла; состязательный и динамический дизайн benchmark-ов; лингвистика, стоящая за оценкой LLM.
Ключевые работы
Stanford Sentiment Treebank (2013, соавтор); DynaSent dynamic benchmark (2021); текущая работа над тестами композиционного обобщения для LLM.