ALCE (2023, avec Chen comme auteur senior) est le benchmark qui a posé la question : lorsqu'un LLM produit du texte avec citations, les sources citées soutiennent-elles réellement les affirmations auxquelles elles sont attachées, ou les citations sont-elles décoratives ? Le cadre décompose l'attribution en composantes mesurables — précision des citations (la citation soutient l'affirmation), rappel des citations (toute affirmation qui devrait être citée l'est), et interaction entre les deux — et montre que les LLM actuels varient énormément dans ce qu'ils réussissent. Pour ai100, qui audite si les moteurs d'IA mentionnent les marques avec un sourçage approprié, c'est le précédent le plus proche de la méthodologie : l'attribution comme axe d'évaluation distinct de l'exactitude brute de la réponse.

À lire lorsque
vous voulez évaluer si les citations d'un modèle font réellement le travail qu'elles semblent faire, ou si elles ne sont que des marqueurs stylistiques attachés à des réponses plausibles.
Thèmes
évaluation automatique du comportement de citation des LLM (ALCE); précision et rappel d'attribution comme métriques distinctes; l'écart entre les citations comme décoration et les citations comme preuve.
Travaux clés
ALCE: Enabling Large Language Models to Generate Text with Citations (2023, auteur senior); Dense Passage Retrieval (2020, co-auteur avec Yih); publications de Princeton NLP sur les modèles de langage augmentés par recherche.