Adversarial Prompting ist der Sammelbegriff für Angriffstechniken, die gezielt Schwachstellen von KI-Sprachmodellen ausnutzen. Ein adversarial Prompt ist eine Eingabe, die so konstruiert ist, dass das Modell sein vorgesehenes Verhalten verlässt – etwa Sicherheitsregeln umgeht, vertrauliche Informationen preisgibt oder unerwünschte Aktionen ausführt. Der Begriff lehnt sich an die Adversarial Examples aus der KI-Forschung an, bei denen minimale Störungen von Bildern oder Texten Modelle zu Fehlklassifikationen bringen.

Wichtige Angriffsarten

  • Prompt-Injection: eingeschleuste Anweisungen, die das Modell zu ungeplanten Handlungen bringen
  • Jailbreak: Umgehung der Sicherheitsrichtlinien des Modells
  • Prompt-Leaking: Herauslocken des versteckten System-Prompts
  • Prompt-Extraktion: gezieltes Auslesen von Anweisungen und internem Kontext

Einordnung und Risiko

Die Open Worldwide Application Security Project (OWASP) führt Prompt-Injection in ihrer LLM-Top-10-Liste auf Platz 1 (LLM01:2025); Adversarial Prompting durchzieht mehrere Kategorien der Liste. Besonders kritisch ist die Kombination mit Agenten-Fähigkeiten: Ein Modell mit Zugriff auf Werkzeuge, Dateien oder Zahlungsdienste kann durch einen einzelnen manipulierten Prompt erheblichen Schaden anrichten.

Gegenmaßnahmen

Eingabe- und Ausgabefilter, Trennung von Anweisungen und Daten, minimale Rechte für Werkzeuge, kontinuierliches Red-Teaming und Monitoring. Ein Sonderfall ist die indirekte Prompt-Injection, bei der der Schadcode nicht vom Nutzer stammt, sondern aus externen Datenquellen in das System gelangt. Verwandte Grundlagen: Prompting-Techniken und Maschinelles Lernen.