Mitchell a écrit le manuel avec lequel le domaine a grandi (1997), fondé le premier Machine Learning Department en 2006, puis est revenu en 2023 aux principes premiers avec un résultat qui complique le récit standard sur l'hallucination des LLM : dans son article avec Amos Azaria, un classifieur simple entraîné sur les activations cachées d'un LLM prédit si le modèle est sur le point de produire une affirmation vraie ou fausse, avec une précision nettement supérieure au hasard. Le modèle, dans un sens lisible, « sait » — et son comportement de surface ne reflète pas ce savoir.

À lire lorsque
vous voulez une lecture, par une figure senior, de la véracité dans les LLM qui ne découle pas des récits actuellement les plus bruyants.
Thèmes
représentations internes de la véracité dans les LLM; sondes mécanistiques pour l'hallucination; histoire plus large du machine learning comme discipline.
Travaux clés
Machine Learning manuel (1997); "The Internal State of an LLM Knows When It's Lying" (2023, avec Azaria); fondation du CMU Machine Learning Department (2006).