← Volver a la lista
Tom Mitchell
Si un modelo de lenguaje tiene una representación interna de si está diciendo la verdad — separable de lo que realmente emite.
Mitchell escribió el libro de texto con el que creció el campo (1997), fundó el primer Machine Learning Department en 2006 y en 2023 volvió a los primeros principios con un resultado que complica la historia estándar sobre la alucinación en LLM: en su artículo con Amos Azaria, un clasificador simple entrenado sobre las activaciones ocultas de un LLM predice si el modelo está a punto de producir una afirmación verdadera o falsa, con una precisión muy por encima del azar. El modelo, en algún sentido legible, «sabe» — y su comportamiento superficial no refleja ese conocimiento.