Jimmy Xiangji Huang
Как информационный поиск работает при масштабировании на хаотичные операционные данные, которыми реально располагают организации, в отличие от чистых benchmark-корпусов, на которых область обычно публикует результаты.
Большая часть академических исследований IR опирается на коллекции веб- или новостного масштаба — корпуса, где поисковая задача чётко определена, а документы достаточно чистые. IR&KM Lab Huang в York уже два десятилетия работает с более репрезентативным случаем: поиском по таким смешанным, гетерогенным, иногда структурированным данным, которыми реально владеют предприятия, и где режимы отказа выглядят иначе, чем всё, что способен поймать benchmark. Его недавние работы по оценке LLM продолжают ту же линию: как ведут себя языковые модели с поисковым усилением, когда корпус, из которого они извлекают данные, — это репозиторий реальной организации, а не кураторская исследовательская коллекция.