Исследования Vaughan давно сосредоточены на вопросе, который большая часть оценки ML пропускает: даже когда у вас есть аккуратное число — точность, калибровка, метрика справедливости, — что происходит, когда это число встречается с человеком, которому надо принять на его основе решение? Её исследования интерпретируемости регулярно показывают, что объяснения, задуманные для укрепления доверия пользователя, могут вместо этого создавать чрезмерную уверенность: люди принимают выводы модели, которые им следовало бы поставить под вопрос, потому что объяснение выглядит авторитетно независимо от своей содержательности. Для ai100, который выпускает отчёты об оценке, по которым клиенты принимают решения на шестизначные суммы, урок прямой: артефакт, который мы поставляем, — не сама оценка, а то, что клиент в итоге считает, будто эта оценка означает.

Стоит читать, когда
вы готовите отчёты об оценке для аудитории вне ML и хотите понимать, как эти отчёты на самом деле читают.
Темы
человеческая интерпретация результатов оценки ML; калибровка и доверие в сотрудничестве человека и AI; фреймворки прозрачности для ML-систем (Aether).
Ключевые работы
"Manipulating and Measuring Model Interpretability" (2021, соавтор); многолетняя работа по справедливости и подотчётности в ML (FATE); организация сообщества WiML (сооснователь, с 2006 года).