Yang Liu
Можно ли использовать более сильную языковую модель для оценки результатов более слабой — и как делать это, не обманывая себя.
Статья G-Eval 2023 года кристаллизовала практику, которая уже около года постепенно входила в область: вместо того чтобы писать ещё одну автоматическую метрику качества NLG, использовать сильную LLM как судью, дать ей prompt со структурированной рубрикой и читать её вывод как оценку. G-Eval лучше всех прежних автоматических метрик коррелировал с человеческими суждениями на тех же задачах, и теперь это цитируемая опорная работа почти для любой системы, которая оценивает сгенерированный текст с помощью модели, включая ai100, для которой важно, чтобы такой подход существовал как защищаемая методология, а не как ловкий хак.