Pappas пришёл в исследования LLM из долгой карьеры в теории управления и формальных методах, где вопрос «как эта система ломается» считается первичным проектным ограничением, встроенным в систему с самого начала. Его статья 2023 года "Jailbreaking Black-Box LLMs in Twenty Queries" переносит эту установку на выравнивание (alignment): атакующей LLM дают целевую модель как чёрный ящик и поручают найти ввод, который обходит обучение целевой модели на безопасность, итеративно уточняя prompt-запросы на основе её ответов. Результат — в среднем достаточно двадцати запросов — переоформляет разговор о безопасности LLM: обучение выравниванию (alignment) — не бинарное исправление, а градуированный барьер, высоту которого можно измерять усилием атакующего.

Стоит читать, когда
вы хотите понимать безопасность LLM как задачу измерения поверхности атаки, информированную теорией управления и формальными методами.
Темы
автоматизированный jailbreak чёрных ящиков LLM (алгоритм PAIR); безопасность как измерение поверхности атаки; методология теории управления, применённая к поведению LLM.
Ключевые работы
"Jailbreaking Black-Box LLMs in Twenty Queries" (2023, старший автор, алгоритм PAIR); длинная дуга работ по теории управления и формальной верификации автономных систем.