Инструменты Anserini и Pyserini, созданные Lin, стали стандартным слоем воспроизводимости для исследований поиска почти сразу после появления: когда NLP-статья сегодня сообщает число baseline для BM25, это число обычно получено из его кода. Та же позиция переносится в HyDE (Hypothetical Document Embeddings, 2023, старший автор): идея состояла в том, чтобы использовать языковую модель для генерации синтетического документа-ответа, получить его embedding и искать по этому embedding, — достаточно чистый метод, чтобы другие группы могли воспроизвести его без переговоров о деталях реализации. Читать Lin — способ понять, какие поисковые результаты в современных LLM-статьях действительно что-то значат, а какие зависят от недокументированных baseline.

Стоит читать, когда
вы хотите понять, воспроизводим ли поисковый результат в статье — и как настроить всё так, чтобы ваш был воспроизводимым.
Темы
плотный поиск и zero-shot поиск через embeddings, сгенерированные LLM; инфраструктура воспроизводимости для исследований IR; мост между сообществами IR и нейронного NLP.
Ключевые работы
Anserini IR toolkit (2017, ведущий); Pyserini (2021, ведущий); HyDE: Precise Zero-Shot Dense Retrieval (2023, старший автор).