Die meisten Methoden zur Halluzinationserkennung beruhen auf mindestens einem von drei Dingen: den internen Wahrscheinlichkeiten des Modells, einer gelabelten Referenzantwort oder einem stärkeren zweiten Modell, das als Judge fungiert. SelfCheckGPT, das Gales’ Cambridge-Gruppe 2023 vorstellte, entfernte alle drei — die Idee besteht darin, dem Modell dieselbe Frage mehrmals zu stellen und zu beobachten, ob die Antworten untereinander konsistent bleiben. Inkonsistenz über Samples hinweg wird als Signal für Erfindung gelesen; Konsistenz als Signal für fundierten Abruf aus dem Training.

Lesenswert, wenn
man ein kommerzielles LLM auditieren muss, das einem nicht gehört und das man nicht mit einem zweiten Modell koppeln kann.
Themen
Zero-Resource-Halluzinationserkennung; Selbstkonsistenz als Evaluationssignal; die Tradition der Modellierung gesprochener Sprache hinter einem großen Teil moderner LLM-Unsicherheitsarbeit.
Zentrale Arbeiten
SelfCheckGPT (2023); jahrzehntelange Grundlagenarbeit zu gesprochener Sprache, die in die Unsicherheitsmethodik einfließt.