Pappas llegó a la investigación sobre LLM desde una larga carrera en teoría de control y métodos formales, donde la pregunta «cómo falla este sistema» se trata como una restricción primaria de diseño, incorporada al sistema desde el principio. Su artículo de 2023 "Jailbreaking Black-Box LLMs in Twenty Queries" aplica esa postura a la alineación: se da a un LLM atacante el modelo objetivo como caja negra y se le instruye para encontrar una entrada que eluda el entrenamiento de seguridad del objetivo, refinando iterativamente sus prompts en función de las respuestas del objetivo. El resultado —que bastan veinte consultas de media— replantea la conversación sobre seguridad de LLM: el entrenamiento de alineación no es una solución binaria, sino una barrera graduada cuya altura puede medirse en esfuerzo del atacante.

Vale la pena seguirlo cuando
se quiere entender la seguridad de LLM como un problema de medición de superficie de ataque informado por teoría de control y métodos formales.
Temas
jailbreak automatizado de LLM de caja negra (algoritmo PAIR); medición de la seguridad como superficie de ataque; metodología de teoría de control aplicada al comportamiento de LLM.
Obras clave
"Jailbreaking Black-Box LLMs in Twenty Queries" (2023, autor sénior, algoritmo PAIR); trayectoria de largo arco en teoría de control y verificación formal de sistemas autónomos.