George J. Pappas
Con qué rapidez un atacante automatizado puede encontrar prompts que rompen la alineación de seguridad de un modelo de lenguaje, y qué implica eso para evaluar la robustez del modelo como tal.
Pappas llegó a la investigación sobre LLM desde una larga carrera en teoría de control y métodos formales, donde la pregunta «cómo falla este sistema» se trata como una restricción primaria de diseño, incorporada al sistema desde el principio. Su artículo de 2023 "Jailbreaking Black-Box LLMs in Twenty Queries" aplica esa postura a la alineación: se da a un LLM atacante el modelo objetivo como caja negra y se le instruye para encontrar una entrada que eluda el entrenamiento de seguridad del objetivo, refinando iterativamente sus prompts en función de las respuestas del objetivo. El resultado —que bastan veinte consultas de media— replantea la conversación sobre seguridad de LLM: el entrenamiento de alineación no es una solución binaria, sino una barrera graduada cuya altura puede medirse en esfuerzo del atacante.