Большая часть академических исследований IR опирается на коллекции веб- или новостного масштаба — корпуса, где поисковая задача чётко определена, а документы достаточно чистые. IR&KM Lab Huang в York уже два десятилетия работает с более репрезентативным случаем: поиском по таким смешанным, гетерогенным, иногда структурированным данным, которыми реально владеют предприятия, и где режимы отказа выглядят иначе, чем всё, что способен поймать benchmark. Его недавние работы по оценке LLM продолжают ту же линию: как ведут себя языковые модели с поисковым усилением, когда корпус, из которого они извлекают данные, — это репозиторий реальной организации, а не кураторская исследовательская коллекция.

Стоит читать, когда
вам нужны исследования IR, которые всерьёз относятся к разрыву между benchmark-корпусами и теми данными, с которыми RAG-системы реально сталкиваются после развёртывания.
Темы
информационный поиск по гетерогенным данным корпоративного масштаба; условия на стороне корпуса, определяющие поведение RAG; систематическая оценка гибридов LLM и IR на невебовых данных.
Ключевые работы
корпус работ по IR для big data и корпоративных корпусов (с 2000-х, York IR&KM Lab); текущие публикации по систематической оценке LLM-IR.