Kaplan lideró "Scaling Laws for Neural Language Models" (2020, autor principal con colaboradores de OpenAI), el artículo que formalizó lo que el campo venía viendo empíricamente: la pérdida de entrenamiento de LLM escala como una ley de potencias limpia de cómputo, parámetros y tamaño del conjunto de datos, con exponentes predecibles. El resultado se convirtió en el instrumento de planificación de toda ejecución de entrenamiento posterior a escala: si se conoce la curva de pérdida, se puede presupuestar cómputo y datos para alcanzar un rendimiento objetivo con pocas sorpresas. La limitación metodológica, sobre la que el propio artículo fue cuidadoso y que el campo ha redescubierto desde entonces por la vía dura, es que el escalado suave de la pérdida no se traduce limpiamente en el escalado suave de ninguna capacidad concreta: las discontinuidades de capacidades emergentes viven en la brecha entre la pérdida agregada y la evaluación a nivel de tarea.

Vale la pena seguirlo cuando
se quiere entender qué predice la teoría subyacente de escalado, qué no predice y dónde se sitúa realmente la frontera metodológica entre predicción a nivel de pérdida y evaluación a nivel de capacidad.
Temas
leyes de escalado para el entrenamiento de modelos de lenguaje; brecha entre escalado de pérdida agregada y predicción de capacidades a nivel de tarea; fundamentos metodológicos del entrenamiento de LLM a gran escala.
Obras clave
"Scaling Laws for Neural Language Models" (2020, autor principal); investigación posterior sobre escalado y capacidades en Anthropic; trayectoria metodológica de física teórica a ML.