← Zurück zur Liste
Tom Mitchell
Ob ein Sprachmodell eine interne Repräsentation davon hat, ob es die Wahrheit sagt — trennbar von dem, was es tatsächlich ausgibt.
Mitchell schrieb das Lehrbuch, mit dem das Feld groß wurde (1997), gründete 2006 das erste Machine Learning Department und kehrte 2023 mit einem Ergebnis zu den Grundprinzipien zurück, das die Standardgeschichte über LLM-Halluzination verkompliziert: In seinem Paper mit Amos Azaria sagt ein einfacher Klassifikator, der auf den verborgenen Aktivierungen eines LLM trainiert wurde, mit einer Genauigkeit deutlich über Zufall voraus, ob das Modell im Begriff ist, eine wahre oder falsche Aussage zu erzeugen. Das Modell „weiß“ es in einem lesbaren Sinn — und sein Oberflächenverhalten spiegelt dieses Wissen nicht wider.