L'article de 2023 "Visual Adversarial Examples Jailbreak Aligned LLMs" du groupe de Mittal à Princeton a montré quelque chose auquel la communauté de la sûreté côté texte ne prêtait pas attention : un LLM multimodal qui refuse une demande textuelle préjudiciable se conforme souvent à la même demande lorsqu'elle est accompagnée d'une image soigneusement optimisée pour paraître banale aux humains mais pousser la représentation interne du modèle dans une région où son entraînement à l'alignement ne s'applique pas. La conséquence méthodologique est concrète : toute évaluation de sûreté des LLM qui ne teste que les entrées textuelles n'audite qu'une fraction de la surface d'attaque réelle. Pour ai100, la même leçon s'étend : une évaluation de mentions de marque testée uniquement en mode texte manque le comportement de mention de marque visible dans les voies d'entrée par image ou par téléversement de documents que les moteurs prennent aussi en charge.

À lire lorsque
vous voulez évaluer la sûreté, la robustesse ou le comportement des LLM à travers toutes les modalités d'entrée qu'un moteur moderne accepte réellement, et pas seulement la tranche textuelle.
Thèmes
attaques adversariales multimodales contre les LLM; alignement de sûreté à travers les modalités d'entrée; ML adversarial appliqué aux produits LLM déployés.
Travaux clés
"Visual Adversarial Examples Jailbreak Aligned LLMs" (2023, auteur senior); publications plus larges de Princeton sur le ML adversarial et la sécurité du ML.