Jennifer Wortman Vaughan
Wie Menschen Ergebnisse der Sprachmodell-Evaluation tatsächlich verstehen und in Handlungen übersetzen — und wo die Lücke zwischen dem liegt, was gemessen wurde, und dem, was geglaubt wird.
Vaughans Forschung konzentriert sich seit langem auf eine Frage, die die meisten ML-Evaluationen überspringen: Selbst wenn man eine saubere Zahl hat — Genauigkeit, Kalibrierung, Fairnessmaß —, was passiert, wenn diese Zahl auf eine menschliche Entscheidungsperson trifft, die sie nutzen muss? Ihre Studien zur Interpretierbarkeit zeigen regelmäßig, dass Erklärungen, die Vertrauen bei Nutzern aufbauen sollen, stattdessen Übervertrauen erzeugen können: Menschen akzeptieren Modellausgaben, die sie hätten hinterfragen sollen, weil die Erklärung unabhängig von ihrer Substanz autoritativ aussah. Für ai100, das Evaluationsberichte produziert, die Kunden für Entscheidungen im sechsstelligen Bereich nutzen werden, ist die Lektion direkt: Das Artefakt, das wir ausliefern, ist nicht der Score selbst — sondern das, was der Kunde am Ende glaubt, dass der Score bedeutet.