Статья G-Eval 2023 года кристаллизовала практику, которая уже около года постепенно входила в область: вместо того чтобы писать ещё одну автоматическую метрику качества NLG, использовать сильную LLM как судью, дать ей prompt со структурированной рубрикой и читать её вывод как оценку. G-Eval лучше всех прежних автоматических метрик коррелировал с человеческими суждениями на тех же задачах, и теперь это цитируемая опорная работа почти для любой системы, которая оценивает сгенерированный текст с помощью модели, включая ai100, для которой важно, чтобы такой подход существовал как защищаемая методология, а не как ловкий хак.

Стоит читать, когда
вы хотите понять методологический фундамент под «пусть модель это оценит» и то, как защищать такой подход в рецензируемом контексте.
Темы
LLM как судья как методология скоринга; prompting с цепочкой рассуждений в оценке; выравнивание (alignment) автоматических метрик NLG с человеческими суждениями.
Ключевые работы
G-Eval: NLG Evaluation Using GPT-4 with Better Human Alignment (2023, ведущий автор); последующие уточнения методологии LLM как судья.