Daxin Jiang
Comment pré-entraîner un encodeur de sorte que les embeddings qu'il produit soient utiles à la recherche — sans jamais le superviser sur une tâche de recherche.
La pratique standard pour les modèles de recherche dense consistait à partir d'un encodeur générique (BERT, RoBERTa) et à lui appliquer un réglage fin (fine-tuning) sur des objectifs propres à la recherche — paires requête-document, pertes contrastives. SimLM (2022, avec Jiang comme auteur senior) a proposé une autre étape de pré-entraînement, produisant des encodeurs déjà orientés vers des représentations utiles à la recherche, de sorte que le réglage fin (fine-tuning) ultérieur demandait beaucoup moins de données annotées pour atteindre la qualité de l'état de l'art. La conséquence méthodologique se situe exactement là où ai100 doit regarder : l'étape d'embedding qui décide quels documents le module de recherche (retriever) considère comme similaires est fonction de choix de pré-entraînement que la plupart des articles ne décrivent jamais.