Большинство методов обнаружения галлюцинаций опирается хотя бы на одну из трёх вещей: внутренние вероятности модели, размеченный эталонный ответ или более мощную вторую модель в роли судьи. SelfCheckGPT, который группа Gales в Cambridge представила в 2023 году, убрал все три. Идея в том, чтобы спросить модель об одном и том же несколько раз и посмотреть, остаются ли ответы самосогласованными. Несогласованность между сэмплами читается как сигнал фабрикации; согласованность — как сигнал опоры на знание, усвоенное при обучении.

Стоит читать, когда
вам нужно аудитировать коммерческую LLM, которой вы не владеете и которую не можете связать со второй моделью.
Темы
обнаружение галлюцинаций без внешних ресурсов; самосогласованность как сигнал оценки; традиция моделирования речи, стоящая за значительной частью современных работ о неопределённости LLM.
Ключевые работы
SelfCheckGPT (2023); десятилетия фундаментальной работы по речи, питающей методологию неопределённости.