Danqi Chen
Déterminer si un modèle de langage qui produit une réponse avec citations ancre réellement cette réponse dans ces citations — ou s'il attache simplement après coup des références plausibles.
ALCE (2023, avec Chen comme auteur senior) est le benchmark qui a posé la question : lorsqu'un LLM produit du texte avec citations, les sources citées soutiennent-elles réellement les affirmations auxquelles elles sont attachées, ou les citations sont-elles décoratives ? Le cadre décompose l'attribution en composantes mesurables — précision des citations (la citation soutient l'affirmation), rappel des citations (toute affirmation qui devrait être citée l'est), et interaction entre les deux — et montre que les LLM actuels varient énormément dans ce qu'ils réussissent. Pour ai100, qui audite si les moteurs d'IA mentionnent les marques avec un sourçage approprié, c'est le précédent le plus proche de la méthodologie : l'attribution comme axe d'évaluation distinct de l'exactitude brute de la réponse.