Die Standardpraxis beim Scoring von Sprachmodellen besteht darin, GPT-4 oder ein anderes großes geschlossenes Modell die Ausgaben bewerten zu lassen — und die Methode funktioniert, ist aber methodisch fragil, und zwar auf eine Weise, die mit der Zeit schlimmer wird. Ein Ergebnis in zwei Jahren zu reproduzieren, wird unmöglich sein, weil der Judge ein geschlossener Dienst mit opakem Release-Zyklus und regelmäßigen Updates der Gewichte ist. Kims Prometheus und Prometheus 2 (Hauptautor, 2023–24) sind der Versuch, der Community ein offenes Gegenstück zu geben: einen Evaluator mit bekannten Gewichten und dokumentiertem Trainingsverfahren, an dem unabhängige Verifikation tatsächlich möglich ist.

Lesenswert, wenn
man LLMs in Forschung evaluieren will, die reproduzierbar bleiben muss, und versteht, dass die Nutzung von GPT-as-Judge die eigene Wissenschaft an die Produkt-Roadmap eines anderen bindet.
Themen
offene LLM-Evaluatoren als Alternativen zu geschlossenen Judges; was ein Transformer tatsächlich vergleicht, wenn er einen anderen „bewertet“; die Grenzen von LLM-as-Judge als Methodik.
Zentrale Arbeiten
Prometheus (2023, Hauptautor); Prometheus 2 (2024, Hauptautor); CoT Collection (2023, Hauptautor).