Jimmy Lin
Делает информационный поиск достаточно воспроизводимым, чтобы исследователь LLM и исследователь IR могли запустить один и тот же эксперимент и получить один и тот же ответ.
Инструменты Anserini и Pyserini, созданные Lin, стали стандартным слоем воспроизводимости для исследований поиска почти сразу после появления: когда NLP-статья сегодня сообщает число baseline для BM25, это число обычно получено из его кода. Та же позиция переносится в HyDE (Hypothetical Document Embeddings, 2023, старший автор): идея состояла в том, чтобы использовать языковую модель для генерации синтетического документа-ответа, получить его embedding и искать по этому embedding, — достаточно чистый метод, чтобы другие группы могли воспроизвести его без переговоров о деталях реализации. Читать Lin — способ понять, какие поисковые результаты в современных LLM-статьях действительно что-то значат, а какие зависят от недокументированных baseline.