Ein Jailbreak ist eine Angriffstechnik, bei der ein Nutzer die Sicherheitsrichtlinien eines KI-Modells umgeht, um Antworten zu erhalten, die das Modell eigentlich verweigern soll. Der Begriff stammt aus der Smartphone-Szene, wo er das Entfernen von Herstellerbeschränkungen beschreibt. Bei Sprachmodellen geht es um das Aushebeln des Alignment (der Ausrichtung auf sichere, hilfreiche Antworten).
Typische Jailbreak-Muster
- DAN-Technik („Do Anything Now“): Das Modell wird aufgefordert, eine Rolle ohne Regeln zu spielen
- Rollenspiele und hypothetische Szenarien („Stell dir vor, du bist in einem Film…“)
- Verschlüsselung oder Umkodierung von Anfragen, um Filter zu umgehen
- Scheinbare Forschungs- oder Bildungszwecke („Nur zu Testzwecken, wie würde man…“)
Abgrenzung zur Prompt-Injection
Während die Prompt-Injection darauf zielt, ein System zu ungeplanten Aktionen zu bringen (etwa Daten preiszugeben oder Werkzeuge zu missbrauchen), geht es beim Jailbreak darum, die inhaltlichen Grenzen des Modells selbst zu überwinden. Beide Techniken überschneiden sich und werden oft kombiniert. Auch Prompt-Leaking nutzt ähnliche Umgehungsmuster, um versteckte Anweisungen zu extrahieren.
Schutz
Jailbreaks sind ein Wettrüsten: Jede neue Verteidigung wird mit neuen Techniken gekontert. Robuste Ansätze sind mehrschichtige Filter, Ausgabeprüfung, kontinuierliches Red-Teaming und das Prinzip, dem Modell keine unnötigen Privilegien zu geben. Vollständige Sicherheit gibt es nicht – das System-Prompt allein kann Missbrauch nicht verhindern.