Seungone Kim
La question de savoir si le domaine peut disposer d'une alternative LLM-évaluateur à poids ouverts, afin que « une boîte noire en juge une autre » cesse d'être la seule option disponible.
La pratique standard pour la notation (scoring) des modèles de langage consiste à demander à GPT-4 ou à un autre grand modèle fermé de noter les sorties — et la méthode fonctionne, tout en étant méthodologiquement fragile d'une manière qui s'aggrave avec le temps. Reproduire un résultat dans deux ans sera impossible, parce que le juge est un service fermé, doté d'un cycle de publication opaque et de mises à jour régulières de ses poids. Prometheus et Prometheus 2 de Kim (auteur principal, 2023–24) tentent de donner à la communauté un analogue ouvert : un évaluateur aux poids connus et à la procédure d'entraînement documentée, face auquel une vérification indépendante devient réellement possible.