La pratique standard pour les modèles de recherche dense consistait à partir d'un encodeur générique (BERT, RoBERTa) et à lui appliquer un réglage fin (fine-tuning) sur des objectifs propres à la recherche — paires requête-document, pertes contrastives. SimLM (2022, avec Jiang comme auteur senior) a proposé une autre étape de pré-entraînement, produisant des encodeurs déjà orientés vers des représentations utiles à la recherche, de sorte que le réglage fin (fine-tuning) ultérieur demandait beaucoup moins de données annotées pour atteindre la qualité de l'état de l'art. La conséquence méthodologique se situe exactement là où ai100 doit regarder : l'étape d'embedding qui décide quels documents le module de recherche (retriever) considère comme similaires est fonction de choix de pré-entraînement que la plupart des articles ne décrivent jamais.

À lire lorsque
vous voulez comprendre les décisions du côté du pré-entraînement qui déterminent ce qu'un module de recherche dense (retriever) peut ou ne peut pas trouver.
Thèmes
méthodologie de pré-entraînement consciente de la recherche; écart entre encodeurs génériques et encodeurs réglés pour la recherche; ce que les choix de pré-entraînement déterminent dans le comportement RAG en aval.
Travaux clés
SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval (2022, auteur senior); travaux plus larges de l'ère pré-LLM sur le NLP web à échelle commerciale chez Bing/Cortana.