Pascale Fung
Ob dasselbe Sprachmodell über verschiedene Sprachen hinweg dieselbe Art von Arbeit leistet — und ob Bewertungsmethodik, die für Englisch gebaut wurde, uns darüber täuscht, was Modelle in allen anderen Sprachen tun.
Fung leitete den 2023 erschienenen Aufsatz „Multitask, Multilingual, Multimodal Evaluation of ChatGPT“ — eine der ersten systematischen empirischen Studien, die ein LLM gleichzeitig durch Aufgaben zu logischem Schließen (Reasoning), Halluzination und Interaktivität in mehreren Sprachen schickte. Die Befunde waren für das Feld wenig schmeichelhaft: Englischsprachige Evaluationsergebnisse überschätzten die Kompetenz des Modells in ressourcenärmeren Sprachen durchgängig; dort erzeugten dieselben prompts deutlich schlechtere Reasoning-Qualität und höhere Halluzinationsraten. Für ai100, das KI-Engines über fünf Sprachregionen hinweg auditiert, ist dies die sauberste veröffentlichte Demonstration dafür, warum sprachweise Evaluation methodisch erforderlich ist und keine optionale Erweiterung einer englischen Baseline.