Minlie Huang
Переносятся ли категории «вредного», используемые для оценки безопасности языковых моделей, из западного контекста в китайскоязычное развёртывание, где регуляторная рамка и культурные категории устроены иначе.
Большая часть публичной оценки безопасности LLM использует категориальные схемы, разработанные западными лабораториями: предвзятость, токсичность, язык ненависти, устойчивость к jailbreak — всё это измеряется на benchmark-ах по англоязычным датасетам и ожиданиям регулирования США и ЕС. Группа Huang CoAI в Tsinghua, вместе с более недавним фреймворком AISafetyLab, выстраивает явную параллельную линию для китайскоязычных LLM: то, что считается «вредным» или «предвзятым» выводом, структурно меняется, когда отличается регуляторная среда, отличаются культурные табу, а поверхность развёрнутой модели обращена к пользователям с другими ожиданиями. Для ai100, который оценивает движки в пяти языковых регионах, такая оценка безопасности с учётом локали — единственная честная версия; делать вид, что одна таксономия безопасности подходит всем пяти локалям, было бы самостоятельной формой предвзятости.