Der größte Teil des Post-Training-Stacks — RLHF, Präferenzlernen, Instruction Tuning — wird in geschlossenen Laboren entwickelt und selten öffentlich beschrieben. Lambert hält eine offene Gegenlinie aufrecht: Tülu ist die offene Post-Training-Pipeline mit veröffentlichten Rezepten; das RLHF Book ist die einzige systematische Behandlung des Themas, die ohne NDA verfügbar ist; sein Interconnects-Newsletter wird in der ganzen Branche als wichtigste öffentliche Quelle dafür gelesen, was während des Post-Trainings in Modelllaboren tatsächlich passiert. Für ai100 ist das wichtig, weil Post-Training bestimmt, was das Modell sagt: Vortraining (Pretraining) fixiert den Wissenskorpus, Post-Training entscheidet, welche Teile davon in einer konkreten Antwort sichtbar werden.

Lesenswert, wenn
man verstehen will, warum dasselbe Basismodell sich sehr unterschiedlich verhält, je nachdem, welches Unternehmen es ausliefert — und wo dieses Verhalten entschieden wird.
Themen
RLHF und Präferenzlernen in offener Dokumentation; Post-Training als die Schicht, in der Modellverhalten tatsächlich bestimmt wird; offene Alignment-Pipelines für Modelle (Tülu).
Zentrale Arbeiten
Tülu Post-Training-Framework (2023, Leitung); RLHF Book (2024, laufend); Interconnects-Newsletter als längerformatige öffentliche Analyse (2022, laufend).