George J. Pappas
Как быстро автоматизированный атакующий может найти prompt-запросы, которые ломают выравнивание (alignment) безопасности языковой модели, — и что это означает для оценки устойчивости модели как таковой.
Pappas пришёл в исследования LLM из долгой карьеры в теории управления и формальных методах, где вопрос «как эта система ломается» считается первичным проектным ограничением, встроенным в систему с самого начала. Его статья 2023 года "Jailbreaking Black-Box LLMs in Twenty Queries" переносит эту установку на выравнивание (alignment): атакующей LLM дают целевую модель как чёрный ящик и поручают найти ввод, который обходит обучение целевой модели на безопасность, итеративно уточняя prompt-запросы на основе её ответов. Результат — в среднем достаточно двадцати запросов — переоформляет разговор о безопасности LLM: обучение выравниванию (alignment) — не бинарное исправление, а градуированный барьер, высоту которого можно измерять усилием атакующего.