L'article "LM vs LM" de 2023, issu du groupe de Globerson, a mis en place un protocole de contre-interrogatoire : un modèle produit une affirmation, un second modèle pose des questions de suivi conçues pour tester les incohérences, et l'affirmation initiale est signalée si les questions de suivi forcent une contradiction. Le dispositif donne au domaine quelque chose qui lui manquait — une méthode de détection de la factualité qui ne requiert pas de vérité terrain annotée, n'exige pas d'accès aux internes du modèle et ne demande pas de faire confiance à l'un ou l'autre modèle pris isolément. L'arc plus long de Globerson est en théorie de l'apprentissage automatique, ce qui façonne la lecture de ce travail : l'évaluation des LLM comme problème d'échantillonnage adversarial et de géométrie de l'information, plutôt que comme problème d'ingénierie de prompt.

À lire lorsque
vous voulez une méthodologie de détection de la factualité ancrée dans des premiers principes théoriques plutôt que dans la chasse empirique aux recettes.
Thèmes
protocoles d'évaluation adversariaux LM-vs-LM; détection de la factualité sans données annotées; théorie de l'apprentissage comme prisme sur le comportement des LLM.
Travaux clés
"LM vs LM: Detecting Factual Errors via Cross-Examination" (2023); travaux plus larges en théorie de l'apprentissage automatique qui informent la méthodologie d'évaluation.