Daxin Jiang
Wie man einen Encoder so vortrainiert, dass die Embeddings, die er erzeugt, für Retrieval gut geeignet sind — ohne jemals auf einer Retrieval-Aufgabe überwacht trainiert zu werden.
Die Standardpraxis bei Dense-Retrieval-Modellen bestand darin, mit einem generischen Encoder (BERT, RoBERTa) zu beginnen und ihn auf retrieval-spezifische Ziele feinabzustimmen (Fine-Tuning) — Anfrage-Dokument-Paare, kontrastive Verluste. SimLM (2022, mit Jiang als Seniorautor) schlug einen anderen Vortrainingsschritt (Pretraining) vor, der Encoder hervorbrachte, die bereits auf für Retrieval nützliche Repräsentationen geprägt waren, sodass die anschließende Feinabstimmung (Fine-Tuning) deutlich weniger gelabelte Daten brauchte, um Qualität auf dem Stand der Technik zu erreichen. Die methodische Konsequenz liegt genau dort, wo ai100 darüber nachdenken muss: Der Embedding-Schritt, der entscheidet, welche Dokumente der Retriever als ähnlich ansieht, ist eine Funktion von Vortrainingsentscheidungen (Pretraining), die die meisten Paper nie beschreiben.