Стандартная практика оценивания языковых моделей — попросить GPT-4 или другую крупную закрытую модель оценить ответы. Метод работает, но методологически он шаток, причём со временем эта шаткость только усиливается. Воспроизвести результат через два года будет невозможно: судья — закрытый сервис с непрозрачным релизным циклом и регулярными обновлениями весов. Prometheus и Prometheus 2 у Kim (ведущий автор, 2023–24) — попытка дать сообществу открытый аналог: оценщик с известными весами и документированной процедурой обучения, относительно которого действительно возможна независимая проверка.

Стоит читать, когда
вы планируете оценивать LLM в исследовании, которое должно оставаться воспроизводимым, и понимаете, что использование GPT как судьи привязывает вашу науку к чужой продуктовой дорожной карте.
Темы
открытые LLM-оценщики как альтернатива закрытым судьям; что один трансформер на самом деле сравнивает, когда «оценивает» другой; пределы LLM как судьи как методологии.
Ключевые работы
Prometheus (2023, ведущий автор); Prometheus 2 (2024, ведущий автор); CoT Collection (2023, ведущий автор).