Das Paper „Visual Adversarial Examples Jailbreak Aligned LLMs“ von 2023 aus Mittals Princeton-Gruppe zeigte etwas, worauf die textseitige Sicherheitscommunity nicht geachtet hatte: Ein multimodales LLM, das eine schädliche Textanfrage verweigert, erfüllt dieselbe Anfrage oft, wenn sie von einem Bild begleitet wird, das sorgfältig so optimiert wurde, dass es für Menschen unauffällig aussieht, aber die interne Repräsentation des Modells in einen Bereich schiebt, in dem sein Alignment-Training nicht greift. Die methodische Konsequenz ist konkret: Jede LLM-Sicherheitsevaluation, die nur Texteingaben testet, auditiert nur einen Bruchteil der tatsächlichen Angriffsfläche. Für ai100 skaliert dieselbe Lektion: Eine Markenerwähnungs-Evaluation, die nur im Textmodus getestet wird, verfehlt das Markenerwähnungsverhalten, das in den Bild-Eingabe- oder Dokument-Upload-Pfaden sichtbar wird, die die Engines ebenfalls unterstützen.

Lesenswert, wenn
man LLM-Sicherheit, Robustheit oder Verhalten über alle Eingabemodalitäten evaluieren will, die eine moderne Engine tatsächlich akzeptiert, nicht nur den text-only-Ausschnitt.
Themen
multimodale adversariale Angriffe auf LLMs; Sicherheits-Alignment über Eingabemodalitäten hinweg; adversariales ML angewandt auf eingesetzte LLM-Produkte.
Zentrale Arbeiten
„Visual Adversarial Examples Jailbreak Aligned LLMs“ (2023, Seniorautor); breitere Adversarial-ML- und ML-Security-Publikationen aus Princeton.