Pang Wei Koh
Ce qui se passe lorsqu'un modèle de langage rencontre le type de données qu'il n'a pas vu pendant l'entraînement — et comment mesurer cet écart rigoureusement, au lieu de simplement le constater après déploiement.
WILDS, que Koh a co-dirigé en 2021, a été la première suite systématique de benchmarks pour les changements de distribution en apprentissage automatique — changement géographique, changement temporel, changement démographique, ces différences du monde réel qui cassent silencieusement les modèles entraînés sur des jeux de données commodes. Le résultat qui a organisé le travail était dégrisant : des modèles à l'état de l'art sur des jeux de test standard perdaient régulièrement la moitié de leur exactitude ou davantage sur les changements WILDS, et aucune technique unique de robustesse ne comblait l'écart. Pour ai100, c'est le problème structurel derrière tout benchmark de moteurs d'IA — ce que nous mesurons sur notre ensemble de requêtes n'est pas ce que les utilisateurs finaux rencontrent, et cet écart mérite le même soin méthodologique que l'exactitude elle-même.