La recuperación generativa se trató primero como una técnica de IR de nicho: entrenar un modelo secuencia a secuencia para emitir identificadores de documentos dada una consulta. La investigación de Li, procedente de un trasfondo en resumen y NLG, reformuló el cuadro: una vez que un sistema puede generar IDs de documentos, también puede generar el resumen de esos documentos condicionado por la consulta, y la respuesta a la consulta condicionada por los documentos, todo desde la misma arquitectura y los mismos pesos. Para ai100, esto importa porque la frontera entre «el sistema recuperó fuentes» y «el sistema las resumió» se vuelve borrosa: un motor moderno en modo de respuesta con citas hace ambas cosas, y la línea de trabajo de Li es el lugar más limpio para ver por qué las dos tareas siempre estuvieron entrelazadas.

Vale la pena seguirlo cuando
se quiere pensar en recuperación, resumen y respuesta a preguntas como un único problema de generación, no como un pipeline de componentes separados.
Temas
recuperación generativa de documentos; unificación del resumen y la recuperación como tareas de generación; resumen condicionado por consulta en sistemas adyacentes a RAG.
Obras clave
Neural Corpus Indexer (NCI, 2022, coautora) y línea posterior de recuperación generativa; larga trayectoria en resumen de texto y NLG centrada en consultas; publicaciones del HK PolyU Cognitive Computing Lab.