La práctica estándar para modelos de recuperación densa era partir de un codificador genérico (BERT, RoBERTa) y aplicarle ajuste fino (fine-tuning) con objetivos específicos de recuperación: pares consulta-documento, pérdidas contrastivas. SimLM (2022, con Jiang como autor sénior) propuso un paso distinto de preentrenamiento que producía codificadores ya sesgados hacia representaciones útiles para recuperación, de modo que el ajuste fino (fine-tuning) posterior necesitaba muchos menos datos etiquetados para igualar la calidad del estado del arte. La consecuencia metodológica cae exactamente donde ai100 tiene que pensarla: el paso de embedding que decide qué documentos ve como similares el recuperador es función de decisiones de preentrenamiento que la mayoría de los artículos nunca describen.

Vale la pena seguirlo cuando
se quieren entender las decisiones del lado del preentrenamiento que dan forma a lo que un recuperador denso puede y no puede encontrar.
Temas
metodología de preentrenamiento orientada a recuperación; brecha entre codificadores genéricos y codificadores ajustados para recuperación; qué determinan las decisiones de preentrenamiento en el comportamiento RAG posterior.
Obras clave
SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval (2022, autor sénior); trabajo más amplio anterior a los LLM sobre NLP web a escala comercial en Bing/Cortana.