Das G-Eval-Paper von 2023 kristallisierte eine Praxis heraus, die sich im Jahr zuvor bereits in das Feld eingeschlichen hatte: Statt noch eine weitere automatische Metrik für NLG-Qualität zu schreiben, nutzt man ein starkes LLM als Judge, gibt ihm per prompt eine strukturierte Rubrik und liest seine Ausgabe als Score. G-Eval korrelierte auf denselben Aufgaben stärker mit menschlichen Urteilen als jede frühere automatische Metrik, und das Paper ist heute die zitierfähige Referenz für fast jedes System, das generierten Text mit einem Modell bewertet — einschließlich des Systems von ai100, das darauf angewiesen ist, dass dieser Ansatz als vertretbare Methodik existiert und nicht nur als cleverer Hack.

Lesenswert, wenn
man die methodische Grundlage unter „lass das Modell es bewerten“ verstehen und sie in einem peer-reviewten Kontext verteidigen will.
Themen
LLM-as-Judge als Scoring-Methodik; Prompting mit Gedankenkette (Chain-of-Thought) in der Evaluation; Alignment automatischer NLG-Metriken mit menschlichen Urteilen.
Zentrale Arbeiten
G-Eval: NLG Evaluation Using GPT-4 with Better Human Alignment (2023, Hauptautor); spätere methodische Verfeinerungen von LLM-as-Judge.