Die Standardpraxis bei Dense-Retrieval-Modellen bestand darin, mit einem generischen Encoder (BERT, RoBERTa) zu beginnen und ihn auf retrieval-spezifische Ziele feinabzustimmen (Fine-Tuning) — Anfrage-Dokument-Paare, kontrastive Verluste. SimLM (2022, mit Jiang als Seniorautor) schlug einen anderen Vortrainingsschritt (Pretraining) vor, der Encoder hervorbrachte, die bereits auf für Retrieval nützliche Repräsentationen geprägt waren, sodass die anschließende Feinabstimmung (Fine-Tuning) deutlich weniger gelabelte Daten brauchte, um Qualität auf dem Stand der Technik zu erreichen. Die methodische Konsequenz liegt genau dort, wo ai100 darüber nachdenken muss: Der Embedding-Schritt, der entscheidet, welche Dokumente der Retriever als ähnlich ansieht, ist eine Funktion von Vortrainingsentscheidungen (Pretraining), die die meisten Paper nie beschreiben.

Lesenswert, wenn
man die Entscheidungen auf der Seite des Vortrainings (Pretraining) verstehen will, die prägen, was ein Dense Retriever finden kann und was nicht.
Themen
retrieval-bewusste Vortrainingsmethodik (Pretraining); die Lücke zwischen generischen Encodern und retrieval-abgestimmten Encodern; was Vortrainingsentscheidungen (Pretraining) im nachgelagerten RAG-Verhalten bestimmen.
Zentrale Arbeiten
SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval (2022, Seniorautor); breitere Arbeit aus der Vor-LLM-Ära zu Web-NLP im kommerziellen Maßstab bei Bing/Cortana.