Fung leitete den 2023 erschienenen Aufsatz „Multitask, Multilingual, Multimodal Evaluation of ChatGPT“ — eine der ersten systematischen empirischen Studien, die ein LLM gleichzeitig durch Aufgaben zu logischem Schließen (Reasoning), Halluzination und Interaktivität in mehreren Sprachen schickte. Die Befunde waren für das Feld wenig schmeichelhaft: Englischsprachige Evaluationsergebnisse überschätzten die Kompetenz des Modells in ressourcenärmeren Sprachen durchgängig; dort erzeugten dieselben prompts deutlich schlechtere Reasoning-Qualität und höhere Halluzinationsraten. Für ai100, das KI-Engines über fünf Sprachregionen hinweg auditiert, ist dies die sauberste veröffentlichte Demonstration dafür, warum sprachweise Evaluation methodisch erforderlich ist und keine optionale Erweiterung einer englischen Baseline.

Lesenswert, wenn
man Sprachmodellverhalten über mehrere Sprachumgebungen hinweg evaluieren muss und die empirische Literatur will, die zeigt, warum Tests pro Sprache nicht verhandelbar sind.
Themen
mehrsprachige Evaluation von LLMs (logisches Schließen (Reasoning), Halluzination, Dialog); empathische und emotional bewusste Dialogsysteme; methodische Konsequenzen englischzentrierten benchmark-Designs.
Zentrale Arbeiten
„Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity“ (2023, Seniorautorin); CAiRE-Publikationen zu Conversational AI; langfristige Arbeiten zu Cross-Lingual NLP seit den 1990er-Jahren.