George J. Pappas
La rapidité avec laquelle un attaquant automatisé peut trouver des prompts qui brisent l'alignement de sûreté d'un modèle de langage — et ce que cela signifie pour évaluer la robustesse du modèle en tant que telle.
Pappas est arrivé à la recherche sur les LLM après une longue carrière en théorie du contrôle et en méthodes formelles, où la question « comment ce système échoue-t-il ? » est traitée comme une contrainte de conception primaire, intégrée au système dès le départ. Son article de 2023, "Jailbreaking Black-Box LLMs in Twenty Queries", applique cette posture à l'alignement : un LLM attaquant reçoit le modèle cible comme boîte noire et a pour consigne de trouver une entrée qui contourne l'entraînement de sûreté de la cible, en affinant itérativement ses prompts à partir des réponses de la cible. Le résultat — vingt requêtes suffisent en moyenne — recadre la conversation sur la sûreté des LLM : l'entraînement à l'alignement n'est pas une correction binaire, mais une barrière graduée dont la hauteur peut être mesurée en effort d'attaquant.