Prateek Mittal
Как визуальные входы становятся новой поверхностью атаки для языковых моделей с выравниванием (alignment) по безопасности, которые принимают мультимодальные запросы.
Статья 2023 года "Visual Adversarial Examples Jailbreak Aligned LLMs" из группы Mittal в Princeton показала то, на что сообщество текстовой безопасности не обращало внимания: мультимодальная LLM, которая отказывается выполнять вредный текстовый запрос, часто соглашается на тот же запрос, если к нему приложено изображение, тщательно оптимизированное так, чтобы выглядеть для человека непримечательно, но сдвигать внутреннее представление модели в область, где её обучение выравниванию (alignment) не срабатывает. Методологическое следствие конкретно: любая оценка безопасности LLM, которая тестирует только текстовые входы, аудирует лишь часть реальной поверхности атаки. Для ai100 тот же урок масштабируется: оценка упоминаний бренда, проверенная только в текстовом режиме, пропускает поведение упоминания бренда, видимое в путях с вводом изображений или загрузкой документов, которые эти движки тоже поддерживают.