← Назад к списку
Mark Gales
Обнаруживает галлюцинации языковой модели без доступа ни к её весам, ни к эталонным данным.
Большинство методов обнаружения галлюцинаций опирается хотя бы на одну из трёх вещей: внутренние вероятности модели, размеченный эталонный ответ или более мощную вторую модель в роли судьи. SelfCheckGPT, который группа Gales в Cambridge представила в 2023 году, убрал все три. Идея в том, чтобы спросить модель об одном и том же несколько раз и посмотреть, остаются ли ответы самосогласованными. Несогласованность между сэмплами читается как сигнал фабрикации; согласованность — как сигнал опоры на знание, усвоенное при обучении.