WILDS, que Koh a co-dirigé en 2021, a été la première suite systématique de benchmarks pour les changements de distribution en apprentissage automatique — changement géographique, changement temporel, changement démographique, ces différences du monde réel qui cassent silencieusement les modèles entraînés sur des jeux de données commodes. Le résultat qui a organisé le travail était dégrisant : des modèles à l'état de l'art sur des jeux de test standard perdaient régulièrement la moitié de leur exactitude ou davantage sur les changements WILDS, et aucune technique unique de robustesse ne comblait l'écart. Pour ai100, c'est le problème structurel derrière tout benchmark de moteurs d'IA — ce que nous mesurons sur notre ensemble de requêtes n'est pas ce que les utilisateurs finaux rencontrent, et cet écart mérite le même soin méthodologique que l'exactitude elle-même.

À lire lorsque
vous soupçonnez qu'un résultat de benchmark ne survivra pas au contact avec des données de déploiement réel, et vous voulez la littérature qui a transformé ce soupçon en catégories mesurables de changement.
Thèmes
benchmarks de changement de distribution (WILDS); robustesse des modèles de fondation en conditions réalistes; écart entre évaluation en distribution et comportement en déploiement.
Travaux clés
suite de benchmarks de changement de distribution WILDS (2021, codirection); publications sur la robustesse des modèles de fondation (2021 et après); travaux récents sur les modèles de langage augmentés par recherche et l'attribution de jeux de données.