La investigación de Vaughan lleva mucho tiempo centrada en una pregunta que la mayoría de la evaluación en ML omite: incluso cuando se tiene un número limpio —precisión, calibración, medida de equidad—, ¿qué ocurre cuando ese número llega a un decisor humano que tiene que usarlo? Sus estudios sobre interpretabilidad encuentran de forma recurrente que las explicaciones destinadas a generar confianza en el usuario pueden producir sobreconfianza, con personas que aceptan salidas del modelo que deberían haber cuestionado, porque la explicación parecía autorizada con independencia de su sustancia. Para ai100, que produce informes de evaluación que los clientes usarán para tomar decisiones de seis cifras, la lección es directa: el artefacto que entregamos no es la puntuación en sí, sino lo que el cliente acaba creyendo que significa la puntuación.

Vale la pena seguirlo cuando
se producen informes de evaluación para audiencias no especializadas en ML y se quiere saber cómo se leen realmente esos informes.
Temas
interpretación humana de resultados de evaluación de ML; calibración y confianza en la colaboración humano-IA; marcos de transparencia para sistemas de ML (Aether).
Obras clave
"Manipulating and Measuring Model Interpretability" (2021, coautora); trabajo de larga duración sobre equidad y rendición de cuentas en ML (FATE); organización de la comunidad WiML (cofundadora, 2006 en adelante).