George J. Pappas
Wie schnell ein automatisierter Angreifer prompts finden kann, die das Sicherheits-Alignment eines Sprachmodells brechen — und was das für die Bewertung von Modellrobustheit als solcher bedeutet.
Pappas kam aus einer langen Karriere in Regelungstheorie und formalen Methoden zur LLM-Forschung, wo die Frage „Wie scheitert dieses System?“ als primäre Designbedingung behandelt wird, von Anfang an in das System eingebaut. Sein Paper von 2023 „Jailbreaking Black-Box LLMs in Twenty Queries“ wendet diese Haltung auf Alignment an: Ein Angreifer-LLM erhält das Zielmodell als Blackbox und bekommt die Aufgabe, eine Eingabe zu finden, die das Sicherheitstraining des Ziels umgeht, wobei es seine prompts iterativ anhand der Antworten des Zielmodells verfeinert. Das Ergebnis — dass im Durchschnitt zwanzig Abfragen genügen — rahmt die Diskussion über LLM-Sicherheit neu: Alignment-Training ist keine binäre Lösung, sondern eine gestufte Barriere, deren Höhe sich in Angreiferaufwand messen lässt.