Mitchell написал учебник, на котором выросла область (1997), основал первый Machine Learning Department в 2006 году, а в 2023-м вернулся к первоосновам с результатом, который усложняет стандартный рассказ о галлюцинациях LLM: в его статье с Amos Azaria простой классификатор, обученный на скрытых активациях LLM, предсказывает, собирается ли модель выдать истинное или ложное утверждение, с точностью заметно выше случайной. Модель, в некотором интерпретируемом смысле, «знает» — но её поверхностное поведение этого знания не отражает.

Стоит читать, когда
вам нужен взгляд крупного представителя области на правдивость LLM, не являющийся производной от самых громких текущих нарративов.
Темы
внутренние представления правдивости в LLM; механистические зондирующие методы для галлюцинаций; более широкая история машинного обучения как дисциплины.
Ключевые работы
учебник Machine Learning (1997); "The Internal State of an LLM Knows When It's Lying" (2023, с Azaria); основание CMU Machine Learning Department (2006).