Nathan Lambert
Was mit einem Sprachmodell zwischen „auf Internetdaten trainiert“ und „beantwortet eine Frage so, wie es sie beantwortet“ geschieht — und wie man diesen Schritt öffentlich untersucht.
Der größte Teil des Post-Training-Stacks — RLHF, Präferenzlernen, Instruction Tuning — wird in geschlossenen Laboren entwickelt und selten öffentlich beschrieben. Lambert hält eine offene Gegenlinie aufrecht: Tülu ist die offene Post-Training-Pipeline mit veröffentlichten Rezepten; das RLHF Book ist die einzige systematische Behandlung des Themas, die ohne NDA verfügbar ist; sein Interconnects-Newsletter wird in der ganzen Branche als wichtigste öffentliche Quelle dafür gelesen, was während des Post-Trainings in Modelllaboren tatsächlich passiert. Für ai100 ist das wichtig, weil Post-Training bestimmt, was das Modell sagt: Vortraining (Pretraining) fixiert den Wissenskorpus, Post-Training entscheidet, welche Teile davon in einer konkreten Antwort sichtbar werden.