ALCE (2023, con Chen como autora sénior) es el benchmark que puso la pregunta sobre la mesa: cuando un LLM produce texto con citas, ¿las fuentes citadas respaldan realmente las afirmaciones a las que se adjuntan, o las citas son decorativas? El marco descompone la atribución en componentes medibles —precisión de cita (la cita respalda la afirmación), exhaustividad de cita (toda afirmación que debería citarse está citada) y la interacción entre ambas— y muestra que los LLM actuales varían enormemente en cuáles de esos aspectos resuelven bien. Para ai100, que audita si los motores de IA mencionan marcas con fuentes adecuadas, este es el precedente más cercano para la metodología: la atribución como eje de evaluación separado de la exactitud bruta de la respuesta.

Vale la pena seguirlo cuando
se quiere evaluar si las citas de un modelo hacen realmente el trabajo que parecen hacer, o si son solo marcadores estilísticos adjuntos a respuestas plausibles.
Temas
evaluación automática del comportamiento de citación en LLM (ALCE); precisión y exhaustividad de atribución como métricas separadas; la brecha entre citas como decoración y citas como evidencia.
Obras clave
ALCE: Enabling Large Language Models to Generate Text with Citations (2023, autora sénior); Dense Passage Retrieval (2020, coautora con Yih); publicaciones de Princeton NLP sobre modelos de lenguaje aumentados por recuperación.