Сначала генеративный поиск воспринимали как нишевую технику информационного поиска: обучить модель sequence-to-sequence выдавать идентификаторы документов по запросу. Работы Li, выросшие из суммаризации и NLG, переопределили эту картину: если система умеет генерировать ID документов, она может той же архитектурой и теми же весами генерировать и резюме этих документов с учётом запроса, и ответ на запрос с учётом документов. Для ai100 это важно потому, что граница между «система нашла источники» и «система их суммировала» становится размытой: современный движок в режиме ответа с цитированием источников делает и то и другое, а линия работ Li — одно из самых ясных мест, где видно, почему эти две задачи всегда были сцеплены.

Стоит читать, когда
вы хотите мыслить поиск, суммаризацию и ответы на вопросы как единую задачу генерации, а не как конвейер из отдельных компонентов.
Темы
генеративный поиск документов; объединение суммаризации и поиска как задач генерации; суммаризация с учётом запроса в системах, смежных с RAG.
Ключевые работы
Neural Corpus Indexer (NCI, 2022, соавтор) и последующая линия работ по генеративному поиску; большой корпус работ по суммаризации текста и query-focused NLG; публикации HK PolyU Cognitive Computing Lab.