Prateek Mittal
Wie visuelle Eingaben zu einer neuen Angriffsfläche für sicherheitsausgerichtete Sprachmodelle werden, die multimodale Anfragen akzeptieren.
Das Paper „Visual Adversarial Examples Jailbreak Aligned LLMs“ von 2023 aus Mittals Princeton-Gruppe zeigte etwas, worauf die textseitige Sicherheitscommunity nicht geachtet hatte: Ein multimodales LLM, das eine schädliche Textanfrage verweigert, erfüllt dieselbe Anfrage oft, wenn sie von einem Bild begleitet wird, das sorgfältig so optimiert wurde, dass es für Menschen unauffällig aussieht, aber die interne Repräsentation des Modells in einen Bereich schiebt, in dem sein Alignment-Training nicht greift. Die methodische Konsequenz ist konkret: Jede LLM-Sicherheitsevaluation, die nur Texteingaben testet, auditiert nur einen Bruchteil der tatsächlichen Angriffsfläche. Für ai100 skaliert dieselbe Lektion: Eine Markenerwähnungs-Evaluation, die nur im Textmodus getestet wird, verfehlt das Markenerwähnungsverhalten, das in den Bild-Eingabe- oder Dokument-Upload-Pfaden sichtbar wird, die die Engines ebenfalls unterstützen.