Nathan Lambert
Qué le ocurre a un modelo de lenguaje entre «entrenado en internet» y «responder a una pregunta de la forma en que lo hace», y cómo estudiar ese paso en público.
La mayor parte de la pila de posentrenamiento —RLHF, aprendizaje de preferencias, ajuste por instrucciones— se desarrolla dentro de laboratorios cerrados y rara vez se describe públicamente. Lambert mantiene una contralínea abierta: Tülu es el pipeline abierto de posentrenamiento con recetas publicadas; el RLHF Book es el único tratamiento sistemático del tema disponible sin un NDA; su newsletter Interconnects se lee en toda la industria como la principal fuente abierta sobre lo que ocurre realmente dentro de los laboratorios de modelos durante el posentrenamiento. Para ai100 esto importa porque el posentrenamiento determina lo que dice el modelo: el preentrenamiento fija el corpus de conocimiento, el posentrenamiento decide qué partes de él afloran en una respuesta dada.