"Is ChatGPT Good at Search?" (2023, avec Ren comme auteur senior) est l'une des études empiriques les plus nettes sur la possibilité que les grands modèles de langage remplacent les composants de classement traditionnels dans un pipeline de recherche. La réponse est la suivante : pour reclasser un petit ensemble de candidats, oui, assez bien ; pour la recherche de première étape sur un vaste corpus, non, pas vraiment — et l'écart entre ces deux tâches est un point que la plupart des articles centrés sur les LLM passent sous silence. Les travaux plus larges de Ren en recherche d'information conversationnelle poussent la question plus loin : lorsque la recherche se déroule dans une conversation multi-tours, le système fait plusieurs choses à la fois, et elles ne devraient pas toutes être évaluées par benchmark de la même manière.

À lire lorsque
vous voulez des résultats empiriques sur les endroits où les LLM peuvent remplacer des composants traditionnels de recherche d'information et ceux où ils échouent.
Thèmes
les LLM comme reclasseurs dans les pipelines de recherche; recherche d'information conversationnelle; différence entre reclassement d'un ensemble de candidats et recherche de première étape à l'échelle d'un corpus.
Travaux clés
"Is ChatGPT Good at Search? Investigating LLMs as Re-Ranking Agents" (2023, co-auteur); publications en cours de Leiden LIACS sur la recherche d'information conversationnelle et le RAG.