El artículo de 2023 "LM vs LM" del grupo de Globerson estableció un protocolo de contrainterrogatorio: un modelo produce una afirmación, un segundo modelo formula preguntas de seguimiento diseñadas para sondear inconsistencias, y la afirmación original se marca si las preguntas de seguimiento fuerzan una contradicción. El planteamiento da al campo algo que le faltaba: un método de detección de factualidad que no requiere verdad de referencia etiquetada, no requiere acceder a los componentes internos del modelo y no requiere confiar en ninguno de los dos modelos por sí solo. El arco más largo de Globerson está en la teoría del aprendizaje automático, lo que da forma a cómo se lee el trabajo: evaluación de LLM como un problema de muestreo adversarial y geometría de la información, más que como un problema de ingeniería de prompts.

Vale la pena seguirlo cuando
se quiere metodología de detección de factualidad anclada en primeros principios teóricos y no en la búsqueda empírica de recetas.
Temas
protocolos adversariales de evaluación LM-vs-LM; detección de factualidad sin datos etiquetados; teoría del aprendizaje como lente sobre el comportamiento de LLM.
Obras clave
"LM vs LM: Detecting Factual Errors via Cross-Examination" (2023); trabajo más amplio de teoría del ML que informa la metodología de evaluación.