Kaplan возглавил "Scaling Laws for Neural Language Models" (2020, ведущий автор с соавторами из OpenAI), работу, которая формализовала то, что область уже видела эмпирически: функция потерь обучения LLM масштабируется по чистому степенному закону от вычислительных затрат, числа параметров и размера датасета, с предсказуемыми экспонентами. Результат стал инструментом планирования для каждого последующего тренировочного запуска в масштабе: если вы знаете кривую функции потерь, можно спланировать вычисления и данные так, чтобы выйти на целевое качество с малым числом сюрпризов. Методологическое ограничение — которое сама статья аккуратно проговаривала и которое область с тех пор болезненно переоткрыла — в том, что гладкое масштабирование функции потерь не превращается напрямую в гладкое масштабирование конкретной способности: скачки в появлении способностей живут в разрыве между агрегированной функцией потерь и оценкой на уровне задач.

Стоит читать, когда
вы хотите понять, что предсказывает базовая теория масштабирования, чего она не предсказывает и где на самом деле проходит методологическая граница между предсказанием на уровне функции потерь и оценкой способностей на уровне задач.
Темы
законы масштабирования для обучения языковых моделей; разрыв между масштабированием агрегированной функции потерь и предсказанием способностей на уровне задач; методологические основы крупномасштабного обучения LLM.
Ключевые работы
"Scaling Laws for Neural Language Models" (2020, ведущий автор); последующие исследования масштабирования и способностей в Anthropic; корпус работ на стыке теоретической физики и методологии ML.