L'article G-Eval de 2023 a cristallisé une pratique qui s'était insinuée dans le domaine depuis un an : au lieu d'écrire encore une métrique automatique pour la qualité NLG, utiliser un LLM puissant comme juge, lui soumettre une grille structurée dans le prompt, puis lire sa sortie comme une note. G-Eval corrélait mieux avec le jugement humain que toutes les métriques automatiques antérieures sur les mêmes tâches, et l'article est désormais la référence citable pour presque tout système qui note du texte généré au moyen d'un modèle — y compris celui d'ai100, qui dépend de l'existence de cette approche comme méthodologie défendable plutôt que comme simple astuce ingénieuse.

À lire lorsque
vous voulez comprendre le fondement méthodologique de « laisser le modèle noter » et savoir comment le défendre dans un cadre évalué par les pairs.
Thèmes
LLM-juge comme méthodologie de notation (scoring); prompting par chaîne de raisonnement dans l'évaluation; alignement avec le jugement humain des métriques automatiques de NLG.
Travaux clés
G-Eval: NLG Evaluation Using GPT-4 with Better Human Alignment (2023, auteur principal); raffinements ultérieurs de la méthodologie LLM-juge.