Большая часть публичной оценки безопасности LLM использует категориальные схемы, разработанные западными лабораториями: предвзятость, токсичность, язык ненависти, устойчивость к jailbreak — всё это измеряется на benchmark-ах по англоязычным датасетам и ожиданиям регулирования США и ЕС. Группа Huang CoAI в Tsinghua, вместе с более недавним фреймворком AISafetyLab, выстраивает явную параллельную линию для китайскоязычных LLM: то, что считается «вредным» или «предвзятым» выводом, структурно меняется, когда отличается регуляторная среда, отличаются культурные табу, а поверхность развёрнутой модели обращена к пользователям с другими ожиданиями. Для ai100, который оценивает движки в пяти языковых регионах, такая оценка безопасности с учётом локали — единственная честная версия; делать вид, что одна таксономия безопасности подходит всем пяти локалям, было бы самостоятельной формой предвзятости.

Стоит читать, когда
вам нужно оценивать безопасность LLM в неанглоязычных контекстах развёртывания, особенно в китайскоязычных средах, где регуляторные и культурные категории расходятся.
Темы
оценка безопасности LLM с учётом локали; безопасность диалоговых систем и выявление злоупотреблений; китайскоязычная экосистема открытых LLM (линия ChatGLM).
Ключевые работы
серия открытых языковых моделей ChatGLM (с 2022 года, ключевой участник); фреймворк оценки безопасности AISafetyLab (с 2023 года, продолжается); публикации группы CoAI по безопасности диалоговых систем.