Die meiste öffentliche Evaluation von LLM-Sicherheit nutzt Kategorieschemata, die von westlichen Labs entwickelt wurden — Bias, Toxizität, Hate Speech, Jailbreak-Resistenz, alles gemessen an englischsprachigen Datensätzen und regulatorischen Erwartungen aus den USA und der EU. Huangs CoAI-Gruppe bei Tsinghua betreibt mit dem neueren AISafetyLab-Framework ein explizites Gegenstück für chinesischsprachige LLMs: Was als „schädliche“ oder „voreingenommene“ Ausgabe gilt, sieht strukturell anders aus, wenn die regulatorische Umgebung anders ist, die kulturellen Tabus anders sind und die Oberfläche ausgelieferter Modelle Nutzer mit anderen Erwartungen erreicht. Für ai100, das Engines evaluiert, die fünf Sprachregionen bedienen, ist diese Art lokalspezifischer Sicherheits-Evaluation die einzig ehrliche Version — so zu tun, als passe eine einzige Sicherheitstaxonomie auf alle fünf Regionen, wäre selbst eine Form von Bias.

Lesenswert, wenn
man LLM-Sicherheit in nicht-anglophonen Deployment-Kontexten evaluieren muss, besonders in chinesischsprachigen Umgebungen, in denen regulatorische und kulturelle Kategorien auseinanderlaufen.
Themen
lokalitätsbewusste LLM-Sicherheitsevaluation; Sicherheit und Missbrauchserkennung in Dialogsystemen; das chinesischsprachige Open-LLM-Ökosystem (ChatGLM-Linie).
Zentrale Arbeiten
ChatGLM-Reihe offener Sprachmodelle (seit 2022, maßgeblicher Mitwirkender); AISafetyLab-Framework für Sicherheits-Evaluation (2023, laufend); Publikationen der CoAI-Gruppe zu Conversational-AI-Sicherheit.