Mitchell schrieb das Lehrbuch, mit dem das Feld groß wurde (1997), gründete 2006 das erste Machine Learning Department und kehrte 2023 mit einem Ergebnis zu den Grundprinzipien zurück, das die Standardgeschichte über LLM-Halluzination verkompliziert: In seinem Paper mit Amos Azaria sagt ein einfacher Klassifikator, der auf den verborgenen Aktivierungen eines LLM trainiert wurde, mit einer Genauigkeit deutlich über Zufall voraus, ob das Modell im Begriff ist, eine wahre oder falsche Aussage zu erzeugen. Das Modell „weiß“ es in einem lesbaren Sinn — und sein Oberflächenverhalten spiegelt dieses Wissen nicht wider.

Lesenswert, wenn
man die Einschätzung einer Seniorfigur zur Wahrhaftigkeit in LLMs will, die nicht von den lautesten aktuellen Narrativen abgeleitet ist.
Themen
interne Repräsentationen von Wahrhaftigkeit in LLMs; mechanistische Probes für Halluzinationen; die breitere Geschichte von maschinellem Lernen als Disziplin.
Zentrale Arbeiten
Lehrbuch Machine Learning (1997); „The Internal State of an LLM Knows When It's Lying“ (2023, mit Azaria); Gründung des CMU Machine Learning Department (2006).