Jared Kaplan
Si la pérdida de un modelo de lenguaje es una función suave de cómputo, datos y tamaño del modelo, y qué permite predecir (y no predecir) esa suavidad sobre capacidades a mayor escala.
Kaplan lideró "Scaling Laws for Neural Language Models" (2020, autor principal con colaboradores de OpenAI), el artículo que formalizó lo que el campo venía viendo empíricamente: la pérdida de entrenamiento de LLM escala como una ley de potencias limpia de cómputo, parámetros y tamaño del conjunto de datos, con exponentes predecibles. El resultado se convirtió en el instrumento de planificación de toda ejecución de entrenamiento posterior a escala: si se conoce la curva de pérdida, se puede presupuestar cómputo y datos para alcanzar un rendimiento objetivo con pocas sorpresas. La limitación metodológica, sobre la que el propio artículo fue cuidadoso y que el campo ha redescubierto desde entonces por la vía dura, es que el escalado suave de la pérdida no se traduce limpiamente en el escalado suave de ninguna capacidad concreta: las discontinuidades de capacidades emergentes viven en la brecha entre la pérdida agregada y la evaluación a nivel de tarea.