Generatives Retrieval wurde zunächst als Nischentechnik des Information Retrieval behandelt: Man trainiert ein Sequence-to-Sequence-Modell darauf, zu einer Anfrage Dokument-IDs auszugeben. Lis Forschung, aus einem Hintergrund in Zusammenfassung und NLG kommend, rahmte das Bild neu — sobald ein System Dokument-IDs generieren kann, kann es aus derselben Architektur und denselben Gewichten des Modells auch die Zusammenfassung dieser Dokumente, konditioniert auf die Anfrage, und die Antwort auf die Anfrage, konditioniert auf die Dokumente, generieren. Für ai100 ist das wichtig, weil die Grenze zwischen „das System hat Quellen abgerufen“ und „das System hat sie zusammengefasst“ unscharf wird: Eine moderne Engine im Antwort-mit-Zitaten-Modus tut beides, und Lis Forschungslinie ist der klarste Ort, um zu sehen, warum die beiden Aufgaben schon immer ineinander verschränkt waren.

Lesenswert, wenn
man Retrieval, Zusammenfassung und Fragebeantwortung als ein einziges Generierungsproblem denken will und nicht als Pipeline getrennter Komponenten.
Themen
generatives Dokumenten-Retrieval; die Vereinheitlichung von Zusammenfassung und Retrieval als Generierungsaufgaben; anfragekonditionierte Zusammenfassung in RAG-nahen Systemen.
Zentrale Arbeiten
Neural Corpus Indexer (NCI, 2022, Mitautor) und die nachgelagerte Linie des generativen Retrievals; langjähriges Werk zu Textzusammenfassung und anfragefokussierter NLG; Publikationen des HK PolyU Cognitive Computing Lab.