← Volver a la lista
Mark Gales
Detectar alucinaciones en un modelo de lenguaje sin acceso a sus pesos ni a la verdad de referencia.
La mayoría de los métodos de detección de alucinaciones dependen de al menos una de tres cosas: las probabilidades internas del modelo, una respuesta de referencia etiquetada o un segundo modelo más potente que actúa como juez. SelfCheckGPT, que el grupo de Cambridge de Gales introdujo en 2023, eliminó las tres: la idea es preguntar lo mismo al modelo varias veces y observar si las respuestas siguen siendo autoconsistentes. La inconsistencia entre muestras se lee como señal de fabricación; la consistencia, como señal de recuperación anclada en el entrenamiento.