La plupart des évaluations publiques de la sûreté des LLM utilisent des schémas de catégories développés par des laboratoires occidentaux — biais, toxicité, discours de haine, résistance aux jailbreaks, le tout évalué sur des jeux de données anglophones et selon des attentes réglementaires américaines ou européennes. Le groupe CoAI de Huang à Tsinghua, avec le cadre plus récent AISafetyLab, met en place un parallèle explicite pour les LLM en langue chinoise : ce qui compte comme sortie « préjudiciable » ou « biaisée » a une structure différente lorsque l'environnement réglementaire diffère, que les tabous culturels diffèrent, et que la surface du modèle déployé atteint des utilisateurs aux attentes différentes. Pour ai100, qui évalue des moteurs servant cinq régions linguistiques, ce type d'évaluation de la sûreté sensible au contexte local est la seule version honnête — prétendre qu'une seule taxonomie de sûreté convient aux cinq contextes locaux serait sa propre forme de biais.

À lire lorsque
vous devez évaluer la sûreté des LLM dans des contextes de déploiement non anglophones, en particulier dans les environnements de langue chinoise où les catégories réglementaires et culturelles divergent.
Thèmes
évaluation de la sûreté des LLM sensible au contexte local; sûreté des systèmes de dialogue et détection des abus; écosystème chinois des LLM ouverts (lignée ChatGLM).
Travaux clés
série de modèles de langage ouverts ChatGLM (2022 et après, contributeur clé); cadre d'évaluation de la sûreté AISafetyLab (2023, en cours); publications du groupe CoAI sur la sûreté de l'IA conversationnelle.