Статья 2023 года "Visual Adversarial Examples Jailbreak Aligned LLMs" из группы Mittal в Princeton показала то, на что сообщество текстовой безопасности не обращало внимания: мультимодальная LLM, которая отказывается выполнять вредный текстовый запрос, часто соглашается на тот же запрос, если к нему приложено изображение, тщательно оптимизированное так, чтобы выглядеть для человека непримечательно, но сдвигать внутреннее представление модели в область, где её обучение выравниванию (alignment) не срабатывает. Методологическое следствие конкретно: любая оценка безопасности LLM, которая тестирует только текстовые входы, аудирует лишь часть реальной поверхности атаки. Для ai100 тот же урок масштабируется: оценка упоминаний бренда, проверенная только в текстовом режиме, пропускает поведение упоминания бренда, видимое в путях с вводом изображений или загрузкой документов, которые эти движки тоже поддерживают.

Стоит читать, когда
вы хотите оценивать безопасность, устойчивость или поведение LLM по всем входным модальностям, которые современный движок реально принимает, а не только в текстовом срезе.
Темы
мультимодальные состязательные атаки на LLM; выравнивание (alignment) безопасности по входным модальностям; состязательный ML применительно к развёрнутым LLM-продуктам.
Ключевые работы
"Visual Adversarial Examples Jailbreak Aligned LLMs" (2023, старший автор); более широкий корпус публикаций по состязательному ML и ML-безопасности из Princeton.