WILDS, que Koh colideró en 2021, fue la primera suite sistemática de benchmarks para cambios de distribución en machine learning: cambio geográfico, cambio temporal, cambio demográfico, los tipos de diferencias del mundo real que rompen silenciosamente modelos entrenados en conjuntos de datos convenientes. El resultado que organizó el trabajo fue desalentador: modelos con rendimiento de estado del arte en conjuntos de prueba estándar perdían rutinariamente la mitad de su exactitud o más en los cambios de WILDS, y ninguna técnica única de robustez cerraba la brecha. Para ai100, este es el problema estructural detrás de cualquier benchmark de motores de IA: lo que medimos en nuestro conjunto de consultas no es lo que encuentran los usuarios finales, y la brecha merece el mismo cuidado metodológico que la exactitud misma.

Vale la pena seguirlo cuando
se sospecha que un resultado de benchmark no sobrevivirá al contacto con datos reales de despliegue, y se quiere la literatura que convirtió esa sospecha en categorías medibles de cambio.
Temas
benchmarks de cambio de distribución (WILDS); robustez de modelos fundacionales en condiciones realistas; brecha entre evaluación dentro de la distribución y comportamiento desplegado.
Obras clave
suite de benchmarks de cambio de distribución WILDS (2021, colíder); publicaciones sobre robustez de modelos fundacionales (2021 en adelante); trabajo reciente sobre LM aumentados por recuperación y atribución de conjuntos de datos.