La mayoría de los métodos de detección de alucinaciones dependen de al menos una de tres cosas: las probabilidades internas del modelo, una respuesta de referencia etiquetada o un segundo modelo más potente que actúa como juez. SelfCheckGPT, que el grupo de Cambridge de Gales introdujo en 2023, eliminó las tres: la idea es preguntar lo mismo al modelo varias veces y observar si las respuestas siguen siendo autoconsistentes. La inconsistencia entre muestras se lee como señal de fabricación; la consistencia, como señal de recuperación anclada en el entrenamiento.

Vale la pena seguirlo cuando
se necesita auditar un LLM comercial que no se posee y que no se puede emparejar con un segundo modelo.
Temas
detección de alucinaciones sin recursos; autoconsistencia como señal de evaluación; la tradición de modelado del habla detrás de buena parte del trabajo moderno sobre incertidumbre en LLM.
Obras clave
SelfCheckGPT (2023); décadas de trabajo fundacional en habla que alimentan la metodología de incertidumbre.