"Is ChatGPT Good at Search?" (2023, con Ren como autor sénior) es uno de los estudios empíricos más limpios sobre si los grandes modelos de lenguaje pueden reemplazar componentes tradicionales de ranking en un pipeline de recuperación. La respuesta resulta ser: para reordenar un conjunto pequeño de candidatos, sí, bastante bien; para la recuperación de primera etapa sobre un corpus amplio, no, en realidad no — y la brecha entre esas dos tareas es una que la mayoría de los artículos centrados en LLM pasa por alto. El trabajo más amplio de Ren en IR conversacional empuja la pregunta más lejos: cuando la recuperación ocurre dentro de una conversación de varios turnos, el sistema está haciendo varias cosas distintas a la vez, y no todas deberían evaluarse con el mismo benchmark.

Vale la pena seguirlo cuando
se quieren resultados empíricos sobre dónde los LLM pueden reemplazar componentes tradicionales de IR y dónde se rompen.
Temas
LLM como reordenadores en pipelines de recuperación; recuperación de información conversacional; diferencia entre reordenamiento de conjuntos de candidatos y recuperación de primera etapa a escala de corpus.
Obras clave
"Is ChatGPT Good at Search? Investigating LLMs as Re-Ranking Agents" (2023, coautor); publicaciones en curso de Leiden LIACS sobre IR conversacional y RAG.