Большая часть стека постобучения — RLHF, обучение предпочтениям, instruction tuning — разрабатывается внутри закрытых лабораторий и редко описывается публично. Lambert ведёт открытую встречную линию: Tülu — открытый конвейер постобучения с опубликованными рецептами; RLHF Book — единственное систематическое изложение темы, доступное без NDA; его рассылку Interconnects читают по всей индустрии как главный открытый источник о том, что на самом деле происходит внутри модельных лабораторий во время постобучения. Для ai100 это важно, потому что постобучение определяет, что модель говорит: предобучение фиксирует корпус знаний, постобучение решает, какие его части всплывут в конкретном ответе.

Стоит читать, когда
вы хотите понять, почему одна и та же базовая модель ведёт себя очень по-разному в зависимости от того, какая компания её выпустила, — и где это поведение определяется.
Темы
RLHF и обучение предпочтениям в открытой документации; постобучение как слой, на котором фактически определяется поведение модели; конвейеры выравнивания (alignment) открытых моделей (Tülu).
Ключевые работы
фреймворк постобучения Tülu (2023, руководитель); RLHF Book (2024, продолжается); рассылка Interconnects как длинноформатная публичная аналитика (2022, продолжается).