← Retour à la liste
Mark Gales
Détecter les hallucinations d'un modèle de langage sans aucun accès à ses poids (du modèle) ni à la vérité terrain.
La plupart des méthodes de détection d'hallucinations reposent sur au moins l'une de trois choses : les probabilités internes du modèle, une réponse de référence annotée, ou un second modèle plus puissant faisant office de juge. SelfCheckGPT, introduit par le groupe de Gales à Cambridge en 2023, a supprimé les trois — l'idée est de poser plusieurs fois la même question au modèle et d'observer si les réponses restent auto-cohérentes. L'incohérence entre échantillons est lue comme un signal de fabrication ; la cohérence, comme un signal d'ancrage dans ce que le modèle a appris.