Десятилетиями оценки релевантности — метки, говорящие, что «этот документ релевантен этому запросу», — производились человеческими ассессорами: дорого и медленно, но это был золотой стандарт оценки информационного поиска. Линия работ Potthast "LLMs for Relevance", ведущаяся вместе с сетью Webis, задала практический вопрос: насколько близко языковая модель может подойти к экспертным человеческим оценкам релевантности и где такая замена тихо ломается? Результаты смешанные в продуктивном смысле: достаточно близко для некоторых типов задач, чтобы включить оценку в масштабах корпусов, недоступных человеческой разметке, и достаточно далеко в других, чтобы любое некритичное использование вносило систематические смещения в benchmark.

Стоит читать, когда
вы хотите понять, уместно ли использовать LLM для оценки релевантности в вашей задаче — и где это неуместно.
Темы
LLM как замена человеческим ассессорам релевантности; крупномасштабная оценка информационного поиска при ограничениях разметки; европейская открытая инфраструктура веб-поиска (OpenWebSearch.eu).
Ключевые работы
линия Webis "LLMs for Relevance" (с 2023); многолетние вклады PAN и TIRA (со Stein); публикации OpenWebSearch.eu по открытой инфраструктуре.