La recherche de Vaughan se concentre depuis longtemps sur une question que la plupart des évaluations en ML évitent : même lorsque vous avez un chiffre propre — exactitude, calibration, mesure d'équité — que se passe-t-il lorsque ce chiffre rencontre un décideur humain qui doit l'utiliser ? Ses études sur l'interprétabilité montrent régulièrement que des explications conçues pour renforcer la confiance de l'utilisateur peuvent au contraire produire de la surconfiance, les gens acceptant des sorties de modèle qu'ils auraient dû questionner, parce que l'explication avait l'air autoritaire indépendamment de sa substance. Pour ai100, qui produit des rapports d'évaluation que des clients utiliseront pour prendre des décisions à six chiffres, la leçon est directe : l'artefact que nous livrons n'est pas le score lui-même — c'est ce que le client finit par croire que le score signifie.

À lire lorsque
vous produisez des rapports d'évaluation pour des publics non spécialistes du ML et voulez savoir comment ces rapports sont réellement lus.
Thèmes
interprétation humaine des résultats d'évaluation en ML; calibration et confiance dans la collaboration humain-IA; cadres de transparence pour les systèmes de ML (Aether).
Travaux clés
"Manipulating and Measuring Model Interpretability" (2021, co-auteur); travaux au long cours sur l'équité et la responsabilité en ML (FATE); organisation de la communauté WiML (cofondatrice, 2006 et après).