Pang Wei Koh
Qué ocurre cuando un modelo de lenguaje encuentra el tipo de datos que no vio durante el entrenamiento, y cómo medir esa brecha con rigor, no solo advertirla después del despliegue.
WILDS, que Koh colideró en 2021, fue la primera suite sistemática de benchmarks para cambios de distribución en machine learning: cambio geográfico, cambio temporal, cambio demográfico, los tipos de diferencias del mundo real que rompen silenciosamente modelos entrenados en conjuntos de datos convenientes. El resultado que organizó el trabajo fue desalentador: modelos con rendimiento de estado del arte en conjuntos de prueba estándar perdían rutinariamente la mitad de su exactitud o más en los cambios de WILDS, y ninguna técnica única de robustez cerraba la brecha. Para ai100, este es el problema estructural detrás de cualquier benchmark de motores de IA: lo que medimos en nuestro conjunto de consultas no es lo que encuentran los usuarios finales, y la brecha merece el mismo cuidado metodológico que la exactitud misma.