WILDS, который Koh совместно возглавил в 2021 году, был первым систематическим набором benchmark-ов для сдвигов распределения в машинном обучении: географический сдвиг, временной сдвиг, демографический сдвиг — те реальные различия, которые незаметно ломают модели, обученные на удобных датасетах. Организующий результат этой работы был отрезвляющим: модели с SOTA-результатами на стандартных тестовых выборках регулярно теряли половину точности или больше на сдвигах WILDS, и ни одна отдельная техника устойчивости не закрывала разрыв. Для ai100 это структурная проблема любого benchmark-а AI-движков: то, что мы измеряем на нашем наборе запросов, не является тем же самым, с чем сталкиваются конечные пользователи, и этот разрыв заслуживает такой же методологической аккуратности, как и сама точность.

Стоит читать, когда
вы подозреваете, что benchmark-результат не переживёт контакта с реальными данными развёртывания, и вам нужна литература, которая превратила это подозрение в измеримые категории сдвига.
Темы
benchmark-и сдвига распределения (WILDS); устойчивость фундаментальных моделей в реалистичных условиях; разрыв между оценкой внутри распределения и поведением при развёртывании.
Ключевые работы
WILDS distribution-shift benchmark suite (2021, один из руководителей); публикации по устойчивости фундаментальных моделей (с 2021 года); недавние работы по языковым моделям с поисковым усилением и атрибуции датасетов.