Prateek Mittal
La manière dont les entrées visuelles deviennent une nouvelle surface d'attaque pour des modèles de langage alignés en sûreté qui acceptent des requêtes multimodales.
L'article de 2023 "Visual Adversarial Examples Jailbreak Aligned LLMs" du groupe de Mittal à Princeton a montré quelque chose auquel la communauté de la sûreté côté texte ne prêtait pas attention : un LLM multimodal qui refuse une demande textuelle préjudiciable se conforme souvent à la même demande lorsqu'elle est accompagnée d'une image soigneusement optimisée pour paraître banale aux humains mais pousser la représentation interne du modèle dans une région où son entraînement à l'alignement ne s'applique pas. La conséquence méthodologique est concrète : toute évaluation de sûreté des LLM qui ne teste que les entrées textuelles n'audite qu'une fraction de la surface d'attaque réelle. Pour ai100, la même leçon s'étend : une évaluation de mentions de marque testée uniquement en mode texte manque le comportement de mention de marque visible dans les voies d'entrée par image ou par téléversement de documents que les moteurs prennent aussi en charge.