El artículo de 2023 "Visual Adversarial Examples Jailbreak Aligned LLMs" del grupo de Mittal en Princeton mostró algo a lo que la comunidad de seguridad centrada en texto no estaba prestando atención: un LLM con multimodalidad que rechaza una solicitud dañina en texto a menudo cumple la misma solicitud cuando va acompañada de una imagen cuidadosamente optimizada para parecer anodina a los humanos pero que empuja la representación interna del modelo hacia una región donde su entrenamiento de alineación no opera. La consecuencia metodológica es concreta: cualquier evaluación de seguridad de LLM que pruebe solo entradas de texto audita una fracción de la superficie de ataque real. Para ai100, la misma lección escala: una evaluación de menciones de marca probada solo en modo texto omite el comportamiento de mención de marcas visible en las rutas de entrada de imagen o de carga de documentos que los motores también admiten.

Vale la pena seguirlo cuando
se quiere evaluar seguridad, robustez o comportamiento de LLM en todas las modalidades de entrada que un motor moderno acepta realmente, no solo la porción de texto.
Temas
ataques adversariales de multimodalidad contra LLM; alineación de seguridad entre modalidades de entrada; ML adversarial aplicado a productos LLM desplegados.
Obras clave
"Visual Adversarial Examples Jailbreak Aligned LLMs" (2023, autor sénior); publicaciones más amplias sobre ML adversarial y seguridad de ML desde Princeton.