Стандартная практика для моделей плотного поиска состояла в том, чтобы взять универсальный энкодер (BERT, RoBERTa) и дообучить (fine-tuning) его на специальных поисковых целях — парах запрос–документ, контрастивных функциях потерь. SimLM (2022, где Jiang был старшим автором) предложила другой этап предобучения: он создавал энкодеры, уже смещённые в сторону представлений, полезных для поиска, так что последующему дообучению требовалось гораздо меньше размеченных данных, чтобы выйти на передовой уровень качества. Методологическое следствие попадает ровно туда, где ai100 приходится об этом думать: шаг эмбеддинга, который решает, какие документы ретривер считает похожими, является функцией решений о предобучении, которые большинство статей вообще не описывает.

Стоит читать, когда
вы хотите понять решения на стороне предобучения, которые формируют то, что плотный ретривер способен и не способен найти.
Темы
методология предобучения, ориентированного на поиск; разрыв между универсальными энкодерами и энкодерами, настроенными под поиск; что именно решения о предобучении определяют в последующем поведении RAG.
Ключевые работы
SimLM: Pre-training with Representation Bottleneck for Dense Passage Retrieval (2022, старший автор); более широкий корпус работ до эпохи LLM по web NLP коммерческого масштаба в Bing/Cortana.