Pang Wei Koh
Что происходит, когда языковая модель сталкивается с такими данными, которых она не видела при обучении, — и как измерить этот разрыв строго, а не просто заметить его после развёртывания.
WILDS, который Koh совместно возглавил в 2021 году, был первым систематическим набором benchmark-ов для сдвигов распределения в машинном обучении: географический сдвиг, временной сдвиг, демографический сдвиг — те реальные различия, которые незаметно ломают модели, обученные на удобных датасетах. Организующий результат этой работы был отрезвляющим: модели с SOTA-результатами на стандартных тестовых выборках регулярно теряли половину точности или больше на сдвигах WILDS, и ни одна отдельная техника устойчивости не закрывала разрыв. Для ai100 это структурная проблема любого benchmark-а AI-движков: то, что мы измеряем на нашем наборе запросов, не является тем же самым, с чем сталкиваются конечные пользователи, и этот разрыв заслуживает такой же методологической аккуратности, как и сама точность.