Pappas est arrivé à la recherche sur les LLM après une longue carrière en théorie du contrôle et en méthodes formelles, où la question « comment ce système échoue-t-il ? » est traitée comme une contrainte de conception primaire, intégrée au système dès le départ. Son article de 2023, "Jailbreaking Black-Box LLMs in Twenty Queries", applique cette posture à l'alignement : un LLM attaquant reçoit le modèle cible comme boîte noire et a pour consigne de trouver une entrée qui contourne l'entraînement de sûreté de la cible, en affinant itérativement ses prompts à partir des réponses de la cible. Le résultat — vingt requêtes suffisent en moyenne — recadre la conversation sur la sûreté des LLM : l'entraînement à l'alignement n'est pas une correction binaire, mais une barrière graduée dont la hauteur peut être mesurée en effort d'attaquant.

À lire lorsque
vous voulez comprendre la sûreté des LLM comme un problème de mesure de surface d'attaque, informé par la théorie du contrôle et les méthodes formelles.
Thèmes
jailbreaking automatisé de LLM en boîte noire (algorithme PAIR); sûreté comme mesure de surface d'attaque; méthodologie de théorie du contrôle appliquée au comportement des LLM.
Travaux clés
"Jailbreaking Black-Box LLMs in Twenty Queries" (2023, auteur senior, algorithme PAIR); œuvre au long cours sur la théorie du contrôle et la vérification formelle des systèmes autonomes.