Danqi Chen
Проверяет, действительно ли языковая модель, которая выдаёт ответ со ссылками, основывает этот ответ на этих ссылках — или просто прикрепляет правдоподобные ссылки постфактум.
ALCE (2023, где Chen — старший автор) — benchmark, который поставил вопрос прямо: когда LLM производит текст со ссылками, действительно ли процитированные источники поддерживают утверждения, к которым они прикреплены, или ссылки декоративны? Фреймворк раскладывает атрибуцию на измеримые компоненты — точность цитирования (цитирование поддерживает утверждение), полноту цитирования (каждое утверждение, которое должно быть процитировано, процитировано) и взаимодействие между ними — и показывает, что текущие LLM резко различаются по тому, что именно им удаётся. Для ai100, который аудитирует, упоминают ли AI-движки бренды с уместной опорой на источники, это ближайший методологический прецедент: атрибуция как отдельная ось оценки, отличная от сырой точности ответа.