Jie Zhou
Ob Sprachmodellen zuzutrauen ist, andere Sprachmodelle in produktiven NLP-Pipelines zu evaluieren.
Die Vorstudie „Is ChatGPT a Good NLG Evaluator?“ von 2023, mit Zhou als Seniorautor, war eine der ersten Arbeiten, die ernsthaft die Frage stellte, die das Feld bereits als selbstverständlich behandelt hatte — kann ein einzelnes geschlossenes LLM das Scoring-Orakel für eine ganze Forschungslinie sein, und was passiert, wenn man das tatsächlich überprüft? Die Befunde waren gemischt: ChatGPT-as-Judge korrelierte bei einigen NLG-Aufgaben gut mit menschlichen Urteilen und bei anderen schlecht, mit Verzerrungen, die erst sichtbar wurden, als man nach Aufgabentypen stratifizierte. Zhous breitere Arbeit liegt in industrieller Conversational AI, was der Frage eine besondere Perspektive gibt: Wenn das eigene Dialogprodukt mit Hunderten Millionen Nutzern spricht, ist „der Evaluator liegt meistens richtig“ keine tragfähige Antwort für die Fälle, in denen er es nicht tut.