Jimmy Xiangji Huang
La manière dont la recherche d'information passe à l'échelle sur les données opérationnelles désordonnées que détiennent les organisations réelles, par opposition aux corpus de benchmark propres sur lesquels le domaine publie effectivement.
La plupart des travaux académiques en recherche d'information s'appuient sur des collections à l'échelle du web ou de l'actualité — des corpus où le problème de recherche est bien défini et où les documents sont relativement propres. L'IR&KM Lab de Huang à York a consacré deux décennies à un cas plus représentatif : la recherche sur le type de données mixtes, hétérogènes, parfois structurées, que les entreprises réelles détiennent, et dont les modes de défaillance ne ressemblent à rien de ce qu'un benchmark capture. Ses travaux récents sur l'évaluation des LLM prolongent cette même perspective : comment des modèles de langage augmentés par recherche se comportent-ils lorsque le corpus dans lequel ils cherchent est le type de dépôt qu'une organisation réelle exploite, et non une collection de recherche curatée.