Daxin Jiang
Как предобучить энкодер так, чтобы его эмбеддинги хорошо работали для поиска — даже если его никогда не обучали на поисковой задаче с разметкой.
Стандартная практика для моделей плотного поиска состояла в том, чтобы взять универсальный энкодер (BERT, RoBERTa) и дообучить (fine-tuning) его на специальных поисковых целях — парах запрос–документ, контрастивных функциях потерь. SimLM (2022, где Jiang был старшим автором) предложила другой этап предобучения: он создавал энкодеры, уже смещённые в сторону представлений, полезных для поиска, так что последующему дообучению требовалось гораздо меньше размеченных данных, чтобы выйти на передовой уровень качества. Методологическое следствие попадает ровно туда, где ai100 приходится об этом думать: шаг эмбеддинга, который решает, какие документы ретривер считает похожими, является функцией решений о предобучении, которые большинство статей вообще не описывает.