Danqi Chen
Si un modelo de lenguaje que produce una respuesta con citas realmente ancla la respuesta en esas citas — o simplemente adjunta referencias plausibles después del hecho.
ALCE (2023, con Chen como autora sénior) es el benchmark que puso la pregunta sobre la mesa: cuando un LLM produce texto con citas, ¿las fuentes citadas respaldan realmente las afirmaciones a las que se adjuntan, o las citas son decorativas? El marco descompone la atribución en componentes medibles —precisión de cita (la cita respalda la afirmación), exhaustividad de cita (toda afirmación que debería citarse está citada) y la interacción entre ambas— y muestra que los LLM actuales varían enormemente en cuáles de esos aspectos resuelven bien. Para ai100, que audita si los motores de IA mencionan marcas con fuentes adecuadas, este es el precedente más cercano para la metodología: la atribución como eje de evaluación separado de la exactitud bruta de la respuesta.