Martin Potthast
Можно ли использовать языковые модели, чтобы судить, релевантен ли документ запросу, — и что меняется, когда они заменяют человеческих ассессоров в этой роли.
Десятилетиями оценки релевантности — метки, говорящие, что «этот документ релевантен этому запросу», — производились человеческими ассессорами: дорого и медленно, но это был золотой стандарт оценки информационного поиска. Линия работ Potthast "LLMs for Relevance", ведущаяся вместе с сетью Webis, задала практический вопрос: насколько близко языковая модель может подойти к экспертным человеческим оценкам релевантности и где такая замена тихо ломается? Результаты смешанные в продуктивном смысле: достаточно близко для некоторых типов задач, чтобы включить оценку в масштабах корпусов, недоступных человеческой разметке, и достаточно далеко в других, чтобы любое некритичное использование вносило систематические смещения в benchmark.