Yang Liu
Ob ein leistungsfähigeres Sprachmodell genutzt werden kann, um die Ausgaben eines weniger leistungsfähigen zu bewerten — und wie man das tut, ohne sich selbst zu täuschen.
Das G-Eval-Paper von 2023 kristallisierte eine Praxis heraus, die sich im Jahr zuvor bereits in das Feld eingeschlichen hatte: Statt noch eine weitere automatische Metrik für NLG-Qualität zu schreiben, nutzt man ein starkes LLM als Judge, gibt ihm per prompt eine strukturierte Rubrik und liest seine Ausgabe als Score. G-Eval korrelierte auf denselben Aufgaben stärker mit menschlichen Urteilen als jede frühere automatische Metrik, und das Paper ist heute die zitierfähige Referenz für fast jedes System, das generierten Text mit einem Modell bewertet — einschließlich des Systems von ai100, das darauf angewiesen ist, dass dieser Ansatz als vertretbare Methodik existiert und nicht nur als cleverer Hack.