Daxin Jiang
Cómo preentrenar un codificador para que los embeddings que produce sean buenos para recuperación — sin supervisarlo nunca en una tarea de recuperación.
La práctica estándar para modelos de recuperación densa era partir de un codificador genérico (BERT, RoBERTa) y aplicarle ajuste fino (fine-tuning) con objetivos específicos de recuperación: pares consulta-documento, pérdidas contrastivas. SimLM (2022, con Jiang como autor sénior) propuso un paso distinto de preentrenamiento que producía codificadores ya sesgados hacia representaciones útiles para recuperación, de modo que el ajuste fino (fine-tuning) posterior necesitaba muchos menos datos etiquetados para igualar la calidad del estado del arte. La consecuencia metodológica cae exactamente donde ai100 tiene que pensarla: el paso de embedding que decide qué documentos ve como similares el recuperador es función de decisiones de preentrenamiento que la mayoría de los artículos nunca describen.