Jimmy Xiangji Huang
Cómo escala la recuperación de información sobre los datos operativos desordenados que poseen las organizaciones reales, frente a los corpus limpios de benchmark sobre los que el campo realmente publica.
La mayoría de la investigación académica en IR se ejecuta sobre colecciones a escala web o a escala de noticias: corpus donde el problema de recuperación está bien definido y los documentos son razonablemente limpios. El IR&KM Lab de Huang en York lleva dos décadas trabajando sobre un caso más representativo: la recuperación sobre el tipo de datos mixtos, heterogéneos y a veces estructurados que poseen las empresas reales, donde los modos de fallo no se parecen a nada que capture un benchmark. Su trabajo reciente de evaluación de LLM extiende esa misma lente: cómo se comportan los modelos de lenguaje aumentados por recuperación cuando el corpus del que recuperan es el tipo de repositorio que opera una organización real, no una colección curada de investigación.