Die Vorstudie „Is ChatGPT a Good NLG Evaluator?“ von 2023, mit Zhou als Seniorautor, war eine der ersten Arbeiten, die ernsthaft die Frage stellte, die das Feld bereits als selbstverständlich behandelt hatte — kann ein einzelnes geschlossenes LLM das Scoring-Orakel für eine ganze Forschungslinie sein, und was passiert, wenn man das tatsächlich überprüft? Die Befunde waren gemischt: ChatGPT-as-Judge korrelierte bei einigen NLG-Aufgaben gut mit menschlichen Urteilen und bei anderen schlecht, mit Verzerrungen, die erst sichtbar wurden, als man nach Aufgabentypen stratifizierte. Zhous breitere Arbeit liegt in industrieller Conversational AI, was der Frage eine besondere Perspektive gibt: Wenn das eigene Dialogprodukt mit Hunderten Millionen Nutzern spricht, ist „der Evaluator liegt meistens richtig“ keine tragfähige Antwort für die Fälle, in denen er es nicht tut.

Lesenswert, wenn
man eine methodisch vorsichtige frühe Behandlung von LLM-as-Judge lesen will, geschrieben von jemandem, der Scoring-Entscheidungen in der Produktion belastbar machen muss.
Themen
frühe empirische Studien zur Zuverlässigkeit von LLM-as-Judge; nach Aufgabentyp stratifizierte Evaluator-Verzerrung; Evaluation industrieller Conversational AI.
Zentrale Arbeiten
„Is ChatGPT a Good NLG Evaluator? A Preliminary Study“ (2023, Seniorautor); laufende Veröffentlichungen zu großen Dialogsystemen.