← Назад к списку
Tom Mitchell
Есть ли у языковой модели внутреннее представление о том, говорит ли она правду, — отделимое от того, что она фактически выводит наружу.
Mitchell написал учебник, на котором выросла область (1997), основал первый Machine Learning Department в 2006 году, а в 2023-м вернулся к первоосновам с результатом, который усложняет стандартный рассказ о галлюцинациях LLM: в его статье с Amos Azaria простой классификатор, обученный на скрытых активациях LLM, предсказывает, собирается ли модель выдать истинное или ложное утверждение, с точностью заметно выше случайной. Модель, в некотором интерпретируемом смысле, «знает» — но её поверхностное поведение этого знания не отражает.