Prateek Mittal
Cómo las entradas visuales se convierten en una nueva superficie de ataque para modelos de lenguaje con alineación de seguridad que aceptan consultas con multimodalidad.
El artículo de 2023 "Visual Adversarial Examples Jailbreak Aligned LLMs" del grupo de Mittal en Princeton mostró algo a lo que la comunidad de seguridad centrada en texto no estaba prestando atención: un LLM con multimodalidad que rechaza una solicitud dañina en texto a menudo cumple la misma solicitud cuando va acompañada de una imagen cuidadosamente optimizada para parecer anodina a los humanos pero que empuja la representación interna del modelo hacia una región donde su entrenamiento de alineación no opera. La consecuencia metodológica es concreta: cualquier evaluación de seguridad de LLM que pruebe solo entradas de texto audita una fracción de la superficie de ataque real. Para ai100, la misma lección escala: una evaluación de menciones de marca probada solo en modo texto omite el comportamiento de mención de marcas visible en las rutas de entrada de imagen o de carga de documentos que los motores también admiten.