La mayoría de la investigación académica en IR se ejecuta sobre colecciones a escala web o a escala de noticias: corpus donde el problema de recuperación está bien definido y los documentos son razonablemente limpios. El IR&KM Lab de Huang en York lleva dos décadas trabajando sobre un caso más representativo: la recuperación sobre el tipo de datos mixtos, heterogéneos y a veces estructurados que poseen las empresas reales, donde los modos de fallo no se parecen a nada que capture un benchmark. Su trabajo reciente de evaluación de LLM extiende esa misma lente: cómo se comportan los modelos de lenguaje aumentados por recuperación cuando el corpus del que recuperan es el tipo de repositorio que opera una organización real, no una colección curada de investigación.

Vale la pena seguirlo cuando
se quiere investigación en IR que se tome en serio la brecha entre corpus de benchmark y el tipo de datos que los sistemas RAG realmente encuentran una vez desplegados.
Temas
recuperación de información sobre datos heterogéneos y a escala empresarial; condiciones del lado del corpus en el comportamiento RAG; evaluación sistemática de híbridos LLM-IR sobre datos no web.
Obras clave
trayectoria de trabajo en IR para big data y corpus empresariales (década de 2000 en adelante, York IR&KM Lab); publicaciones sistemáticas en curso sobre evaluación de LLM-IR.