Yang Liu
Si un modèle de langage plus capable peut servir à noter les sorties d'un modèle moins capable — et comment le faire sans se tromper soi-même.
L'article G-Eval de 2023 a cristallisé une pratique qui s'était insinuée dans le domaine depuis un an : au lieu d'écrire encore une métrique automatique pour la qualité NLG, utiliser un LLM puissant comme juge, lui soumettre une grille structurée dans le prompt, puis lire sa sortie comme une note. G-Eval corrélait mieux avec le jugement humain que toutes les métriques automatiques antérieures sur les mêmes tâches, et l'article est désormais la référence citable pour presque tout système qui note du texte généré au moyen d'un modèle — y compris celui d'ai100, qui dépend de l'existence de cette approche comme méthodologie défendable plutôt que comme simple astuce ingénieuse.