ALCE (2023, где Chen — старший автор) — benchmark, который поставил вопрос прямо: когда LLM производит текст со ссылками, действительно ли процитированные источники поддерживают утверждения, к которым они прикреплены, или ссылки декоративны? Фреймворк раскладывает атрибуцию на измеримые компоненты — точность цитирования (цитирование поддерживает утверждение), полноту цитирования (каждое утверждение, которое должно быть процитировано, процитировано) и взаимодействие между ними — и показывает, что текущие LLM резко различаются по тому, что именно им удаётся. Для ai100, который аудитирует, упоминают ли AI-движки бренды с уместной опорой на источники, это ближайший методологический прецедент: атрибуция как отдельная ось оценки, отличная от сырой точности ответа.

Стоит читать, когда
вы хотите оценить, действительно ли ссылки модели выполняют ту работу, видимость которой создают, или это всего лишь стилистические маркеры, прикреплённые к правдоподобному ответу.
Темы
автоматическая оценка поведения LLM при цитировании (ALCE); точность и полнота атрибуции как отдельные метрики; разрыв между ссылками как декорацией и ссылками как доказательством.
Ключевые работы
ALCE: Enabling Large Language Models to Generate Text with Citations (2023, старший автор); Dense Passage Retrieval (2020, соавтор с Yih); публикации Princeton NLP по языковым моделям с генерацией с поиском.