Nathan Lambert
Ce qui arrive à un modèle de langage entre « entraîné sur Internet » et « répond à votre question comme il le fait » — et comment étudier cette étape publiquement.
La plupart de la pile de post-entraînement — RLHF, apprentissage par préférences, réglage par instructions — est développée à l'intérieur de laboratoires fermés et rarement décrite publiquement. Lambert maintient une contre-ligne ouverte : Tülu est le pipeline ouvert de post-entraînement avec recettes publiées ; le RLHF Book est le seul traitement systématique du sujet accessible sans accord de confidentialité ; sa newsletter Interconnects est lue dans toute l'industrie comme la principale source publique sur ce qui se passe réellement dans les laboratoires de modèles pendant le post-entraînement. Pour ai100, cela compte parce que le post-entraînement détermine ce que le modèle dit : le pré-entraînement fixe le corpus de connaissances, le post-entraînement décide quelles parties de ce corpus remontent dans une réponse donnée.