Jared Kaplan
Является ли функция потерь языковой модели гладкой функцией вычислений, данных и размера модели — и что эта гладкость позволяет предсказывать (и не предсказывать) о способностях на больших масштабах.
Kaplan возглавил "Scaling Laws for Neural Language Models" (2020, ведущий автор с соавторами из OpenAI), работу, которая формализовала то, что область уже видела эмпирически: функция потерь обучения LLM масштабируется по чистому степенному закону от вычислительных затрат, числа параметров и размера датасета, с предсказуемыми экспонентами. Результат стал инструментом планирования для каждого последующего тренировочного запуска в масштабе: если вы знаете кривую функции потерь, можно спланировать вычисления и данные так, чтобы выйти на целевое качество с малым числом сюрпризов. Методологическое ограничение — которое сама статья аккуратно проговаривала и которое область с тех пор болезненно переоткрыла — в том, что гладкое масштабирование функции потерь не превращается напрямую в гладкое масштабирование конкретной способности: скачки в появлении способностей живут в разрыве между агрегированной функцией потерь и оценкой на уровне задач.