La mayor parte de la pila de posentrenamiento —RLHF, aprendizaje de preferencias, ajuste por instrucciones— se desarrolla dentro de laboratorios cerrados y rara vez se describe públicamente. Lambert mantiene una contralínea abierta: Tülu es el pipeline abierto de posentrenamiento con recetas publicadas; el RLHF Book es el único tratamiento sistemático del tema disponible sin un NDA; su newsletter Interconnects se lee en toda la industria como la principal fuente abierta sobre lo que ocurre realmente dentro de los laboratorios de modelos durante el posentrenamiento. Para ai100 esto importa porque el posentrenamiento determina lo que dice el modelo: el preentrenamiento fija el corpus de conocimiento, el posentrenamiento decide qué partes de él afloran en una respuesta dada.

Vale la pena seguirlo cuando
se quiere entender por qué el mismo modelo base se comporta de forma muy distinta según qué empresa lo lanzó, y dónde se decide ese comportamiento.
Temas
RLHF y aprendizaje de preferencias en documentación abierta; posentrenamiento como la capa donde realmente se determina el comportamiento del modelo; pipelines abiertos de alineación de modelos (Tülu).
Obras clave
framework de posentrenamiento Tülu (2023, líder); RLHF Book (2024, en curso); newsletter Interconnects como análisis público de formato largo (2022, en curso).