La plupart des travaux académiques en recherche d'information s'appuient sur des collections à l'échelle du web ou de l'actualité — des corpus où le problème de recherche est bien défini et où les documents sont relativement propres. L'IR&KM Lab de Huang à York a consacré deux décennies à un cas plus représentatif : la recherche sur le type de données mixtes, hétérogènes, parfois structurées, que les entreprises réelles détiennent, et dont les modes de défaillance ne ressemblent à rien de ce qu'un benchmark capture. Ses travaux récents sur l'évaluation des LLM prolongent cette même perspective : comment des modèles de langage augmentés par recherche se comportent-ils lorsque le corpus dans lequel ils cherchent est le type de dépôt qu'une organisation réelle exploite, et non une collection de recherche curatée.

À lire lorsque
vous voulez une recherche d'information qui prenne au sérieux l'écart entre les corpus de benchmark et le type de données que les systèmes RAG rencontrent réellement une fois déployés.
Thèmes
recherche d'information sur des données hétérogènes et à l'échelle de l'entreprise; conditions côté corpus qui façonnent le comportement RAG; évaluation systématique d'hybrides LLM-IR sur des données non issues du web.
Travaux clés
ensemble de travaux sur la recherche d'information pour les corpus de données massives et d'entreprise (années 2000 et après, York IR&KM Lab); publications systématiques en cours sur l'évaluation LLM-IR.