Nathan Lambert
Что происходит с языковой моделью между «обучена на интернете» и «отвечает на ваш вопрос именно так» — и как изучать этот шаг публично.
Большая часть стека постобучения — RLHF, обучение предпочтениям, instruction tuning — разрабатывается внутри закрытых лабораторий и редко описывается публично. Lambert ведёт открытую встречную линию: Tülu — открытый конвейер постобучения с опубликованными рецептами; RLHF Book — единственное систематическое изложение темы, доступное без NDA; его рассылку Interconnects читают по всей индустрии как главный открытый источник о том, что на самом деле происходит внутри модельных лабораторий во время постобучения. Для ai100 это важно, потому что постобучение определяет, что модель говорит: предобучение фиксирует корпус знаний, постобучение решает, какие его части всплывут в конкретном ответе.