„Is ChatGPT Good at Search?“ (2023, mit Ren als Seniorautor) ist eine der saubersten empirischen Studien dazu, ob große Sprachmodelle traditionelle Ranking-Komponenten in einer Retrieval-Pipeline ersetzen können. Die Antwort lautet: Für das Re-Ranking einer kleinen Kandidatenmenge ja, ziemlich gut; für First-Stage-Retrieval über einen großen Korpus nein, nicht wirklich — und die Lücke zwischen diesen beiden Aufgaben ist eine, über die die meisten LLM-zentrierten Paper hinweggehen. Rens breitere Arbeit in Conversational IR treibt die Frage weiter: Wenn Retrieval in einem Multi-Turn-Gespräch stattfindet, tut das System mehrere verschiedene Dinge gleichzeitig, und sie sollten nicht alle nach derselben Benchmark-Logik bewertet werden.

Lesenswert, wenn
man empirische Ergebnisse dazu will, wo LLMs traditionelle IR-Komponenten ersetzen können und wo sie scheitern.
Themen
LLMs als Re-Ranker in Retrieval-Pipelines; Conversational Information Retrieval; der Unterschied zwischen Re-Ranking einer Kandidatenmenge und First-Stage-Retrieval im Korpusmaßstab.
Zentrale Arbeiten
„Is ChatGPT Good at Search? Investigating LLMs as Re-Ranking Agents“ (2023, Mitautor); laufende Leiden LIACS-Publikationen zu Conversational IR und RAG.