Jennifer Wortman Vaughan
La manière dont les gens comprennent réellement les résultats d'évaluation des modèles de langage et agissent à partir d'eux — et l'endroit où se situe l'écart entre ce qui a été mesuré et ce qui finit par être cru.
La recherche de Vaughan se concentre depuis longtemps sur une question que la plupart des évaluations en ML évitent : même lorsque vous avez un chiffre propre — exactitude, calibration, mesure d'équité — que se passe-t-il lorsque ce chiffre rencontre un décideur humain qui doit l'utiliser ? Ses études sur l'interprétabilité montrent régulièrement que des explications conçues pour renforcer la confiance de l'utilisateur peuvent au contraire produire de la surconfiance, les gens acceptant des sorties de modèle qu'ils auraient dû questionner, parce que l'explication avait l'air autoritaire indépendamment de sa substance. Pour ai100, qui produit des rapports d'évaluation que des clients utiliseront pour prendre des décisions à six chiffres, la leçon est directe : l'artefact que nous livrons n'est pas le score lui-même — c'est ce que le client finit par croire que le score signifie.