La plupart des méthodes de détection d'hallucinations reposent sur au moins l'une de trois choses : les probabilités internes du modèle, une réponse de référence annotée, ou un second modèle plus puissant faisant office de juge. SelfCheckGPT, introduit par le groupe de Gales à Cambridge en 2023, a supprimé les trois — l'idée est de poser plusieurs fois la même question au modèle et d'observer si les réponses restent auto-cohérentes. L'incohérence entre échantillons est lue comme un signal de fabrication ; la cohérence, comme un signal d'ancrage dans ce que le modèle a appris.

À lire lorsque
vous devez auditer un LLM commercial que vous ne possédez pas et que vous ne pouvez pas coupler à un second modèle.
Thèmes
détection d'hallucinations sans ressource; auto-cohérence comme signal d'évaluation; la tradition de modélisation de la parole derrière une grande partie des travaux modernes sur l'incertitude dans les LLM.
Travaux clés
SelfCheckGPT (2023); plusieurs décennies de travaux fondateurs sur la parole alimentant la méthodologie de l'incertitude.