← Retour à la liste
Tom Mitchell
Si un modèle de langage possède une représentation interne du fait qu'il dit vrai — séparable de ce qu'il produit effectivement.
Mitchell a écrit le manuel avec lequel le domaine a grandi (1997), fondé le premier Machine Learning Department en 2006, puis est revenu en 2023 aux principes premiers avec un résultat qui complique le récit standard sur l'hallucination des LLM : dans son article avec Amos Azaria, un classifieur simple entraîné sur les activations cachées d'un LLM prédit si le modèle est sur le point de produire une affirmation vraie ou fausse, avec une précision nettement supérieure au hasard. Le modèle, dans un sens lisible, « sait » — et son comportement de surface ne reflète pas ce savoir.