Les boîtes à outils Anserini et Pyserini de Lin sont devenues la couche de reproductibilité par défaut de la recherche d'information dès leur apparition — lorsqu'un article NLP rapporte aujourd'hui une référence BM25, ce chiffre vient généralement de son code. La même posture se retrouve dans HyDE (Hypothetical Document Embeddings, 2023, auteur senior) : l'idée consistait à utiliser un modèle de langage pour générer un document-réponse synthétique, l'encoder en représentation vectorielle, puis effectuer la recherche à partir de cette représentation — une méthode assez nette pour que d'autres groupes puissent la répliquer sans négocier les détails d'implémentation. Lire Lin est la manière de comprendre quels résultats de recherche dans les articles LLM actuels veulent réellement dire quelque chose et lesquels dépendent de références non documentées.

À lire lorsque
vous voulez savoir si un résultat lié à la recherche dans un article est reproductible — et comment configurer vos expériences pour que le vôtre le soit.
Thèmes
recherche dense et recherche zero-shot via représentations vectorielles générées par LLM; infrastructure de reproductibilité pour la recherche en IR; pont entre les communautés IR et NLP neuronal.
Travaux clés
Anserini IR toolkit (2017, responsable); Pyserini (2021, responsable); HyDE: Precise Zero-Shot Dense Retrieval (2023, auteur senior).