La pratique standard pour la notation (scoring) des modèles de langage consiste à demander à GPT-4 ou à un autre grand modèle fermé de noter les sorties — et la méthode fonctionne, tout en étant méthodologiquement fragile d'une manière qui s'aggrave avec le temps. Reproduire un résultat dans deux ans sera impossible, parce que le juge est un service fermé, doté d'un cycle de publication opaque et de mises à jour régulières de ses poids. Prometheus et Prometheus 2 de Kim (auteur principal, 2023–24) tentent de donner à la communauté un analogue ouvert : un évaluateur aux poids connus et à la procédure d'entraînement documentée, face auquel une vérification indépendante devient réellement possible.

À lire lorsque
vous prévoyez d'évaluer des LLM dans une recherche qui doit rester reproductible, et vous comprenez qu'utiliser GPT comme juge arrime votre science à la feuille de route produit de quelqu'un d'autre.
Thèmes
évaluateurs de LLM ouverts comme alternatives aux juges fermés; ce qu'un transformer compare réellement lorsqu'il en « note » un autre; les limites du LLM-juge comme méthodologie.
Travaux clés
Prometheus (2023, auteur principal); Prometheus 2 (2024, auteur principal); CoT Collection (2023, auteur principal).