Jimmy Lin
Rendre la recherche d'information assez reproductible pour qu'un chercheur en LLM et un chercheur en IR puissent exécuter la même expérience et obtenir la même réponse.
Les boîtes à outils Anserini et Pyserini de Lin sont devenues la couche de reproductibilité par défaut de la recherche d'information dès leur apparition — lorsqu'un article NLP rapporte aujourd'hui une référence BM25, ce chiffre vient généralement de son code. La même posture se retrouve dans HyDE (Hypothetical Document Embeddings, 2023, auteur senior) : l'idée consistait à utiliser un modèle de langage pour générer un document-réponse synthétique, l'encoder en représentation vectorielle, puis effectuer la recherche à partir de cette représentation — une méthode assez nette pour que d'autres groupes puissent la répliquer sans négocier les détails d'implémentation. Lire Lin est la manière de comprendre quels résultats de recherche dans les articles LLM actuels veulent réellement dire quelque chose et lesquels dépendent de références non documentées.