Minlie Huang
Ob die Kategorien von „schädlich“, die zur Bewertung der Sicherheit von Sprachmodellen genutzt werden, aus westlichen in chinesischsprachige Deployment-Kontexte übertragbar sind, in denen der regulatorische Rahmen und die kulturellen Kategorien anders sind.
Die meiste öffentliche Evaluation von LLM-Sicherheit nutzt Kategorieschemata, die von westlichen Labs entwickelt wurden — Bias, Toxizität, Hate Speech, Jailbreak-Resistenz, alles gemessen an englischsprachigen Datensätzen und regulatorischen Erwartungen aus den USA und der EU. Huangs CoAI-Gruppe bei Tsinghua betreibt mit dem neueren AISafetyLab-Framework ein explizites Gegenstück für chinesischsprachige LLMs: Was als „schädliche“ oder „voreingenommene“ Ausgabe gilt, sieht strukturell anders aus, wenn die regulatorische Umgebung anders ist, die kulturellen Tabus anders sind und die Oberfläche ausgelieferter Modelle Nutzer mit anderen Erwartungen erreicht. Für ai100, das Engines evaluiert, die fünf Sprachregionen bedienen, ist diese Art lokalspezifischer Sicherheits-Evaluation die einzig ehrliche Version — so zu tun, als passe eine einzige Sicherheitstaxonomie auf alle fünf Regionen, wäre selbst eine Form von Bias.