Seungone Kim
Может ли у области появиться альтернатива в виде LLM-оценщика с открытыми весами, чтобы «один чёрный ящик судит другой чёрный ящик» перестало быть единственным доступным вариантом.
Стандартная практика оценивания языковых моделей — попросить GPT-4 или другую крупную закрытую модель оценить ответы. Метод работает, но методологически он шаток, причём со временем эта шаткость только усиливается. Воспроизвести результат через два года будет невозможно: судья — закрытый сервис с непрозрачным релизным циклом и регулярными обновлениями весов. Prometheus и Prometheus 2 у Kim (ведущий автор, 2023–24) — попытка дать сообществу открытый аналог: оценщик с известными весами и документированной процедурой обучения, относительно которого действительно возможна независимая проверка.