Seungone Kim
Ob das Feld eine LLM-Evaluator-Alternative mit offenen Gewichten bekommen kann, damit „eine Blackbox bewertet eine andere Blackbox“ nicht die einzige verfügbare Option bleibt.
Die Standardpraxis beim Scoring von Sprachmodellen besteht darin, GPT-4 oder ein anderes großes geschlossenes Modell die Ausgaben bewerten zu lassen — und die Methode funktioniert, ist aber methodisch fragil, und zwar auf eine Weise, die mit der Zeit schlimmer wird. Ein Ergebnis in zwei Jahren zu reproduzieren, wird unmöglich sein, weil der Judge ein geschlossener Dienst mit opakem Release-Zyklus und regelmäßigen Updates der Gewichte ist. Kims Prometheus und Prometheus 2 (Hauptautor, 2023–24) sind der Versuch, der Community ein offenes Gegenstück zu geben: einen Evaluator mit bekannten Gewichten und dokumentiertem Trainingsverfahren, an dem unabhängige Verifikation tatsächlich möglich ist.