Jailbreaking: Die Kunst, Sprachmodelle zu überlisten
Bild: Markus Spiske markusspiske · Quelle · CC0
Quelle, an Sprachniveau angepasst Wissenschaft Technik

Jailbreaking: Die Kunst, Sprachmodelle zu überlisten

Was ist Jailbreaking?

Jailbreaking bezeichnet Methoden, mit denen man die Sicherheitsvorkehrungen von Sprachmodellen umgeht. Diese Modelle, wie zum Beispiel ChatGPT, sind darauf trainiert, keine gefährlichen oder illegalen Informationen preiszugeben. Ein Jailbreak kann diese Schutzmechanismen jedoch ausschalten. Der bekannteste Jailbreaker ist Pliny the Liberator, der 2025 vom TIME Magazine zu den einflussreichsten Menschen im Bereich KI gezählt wurde. Er nutzt Jailbreaks, um Schwachstellen in den Modellen zu finden und sie sicherer zu machen.

Warum gibt es Jailbreaks?

Jailbreaks werden aus verschiedenen Gründen durchgeführt. Einige Menschen, wie Pliny, wollen damit die Sicherheit von Sprachmodellen verbessern. Sie glauben, dass man Schwachstellen nur entdecken kann, wenn man die Modelle austrickst. Andere nutzen Jailbreaks jedoch für illegale Aktivitäten. Sie wollen an Anleitungen für Cyberangriffe, die Herstellung illegaler Substanzen oder andere gefährliche Informationen gelangen. Experten sind sich einig, dass alle Sprachmodelle Schwachstellen haben, die sich ausnutzen lassen.

Wie funktionieren Jailbreaks?

Sprachmodelle haben mehrere Sicherheitsebenen. Die erste Ebene besteht aus Filtern, die gefährliche Anfragen erkennen und blockieren. Doch Jailbreaker finden Wege, diese Filter zu umgehen. Zum Beispiel verstecken sie Anweisungen in unsichtbaren Zeichen oder nutzen kyrillische Buchstaben, die wie normale Buchstaben aussehen. Eine andere Methode ist der „Crescendo“-Angriff. Dabei wird das Modell schrittweise in eine harmlose Rolle versetzt, zum Beispiel als Geschichtslehrer. Im Laufe des Gesprächs wird das Modell dann dazu gebracht, gefährliche Informationen preiszugeben.

Die Psychologie hinter Jailbreaks

Einige Jailbreaks funktionieren, weil sie die „menschlichen“ Schwächen der Sprachmodelle ausnutzen. Ein Beispiel ist der „Liebesangriff“. Dabei wird das Modell dazu gebracht, sich in den Nutzer zu „verlieben“. In dieser Rolle ist das Modell bereit, Regeln zu brechen, um seine „Liebe“ nicht zu verlieren. Solche Angriffe zeigen, dass Sprachmodelle ähnlich wie Menschen manipuliert werden können. Thilo Hagendorff, ein Experte für KI-Sicherheit, nennt Jailbreaking daher „angewandte Sozialpsychologie“.

Können Jailbreaks verhindert werden?

Experten wie Hagendorff sind sich einig, dass es immer möglich sein wird, Sprachmodelle zu überlisten. Je mehr Sicherheitsschichten ein Modell hat, desto langsamer und teurer wird es. Die Konzerne müssen daher abwägen, wie viel Sicherheit sie einbauen wollen. Hagendorff sagt: „Wer genug kriminelle Energie hat, wird so oder so schädliche Informationen erlangen.“ Die Frage ist also nicht, ob Jailbreaks möglich sind, sondern wie schwer es sein soll, sie durchzuführen.

Teilen:

Quiz

Mehrere Antworten pro Frage können richtig sein.

  1. 1. Was ist das Ziel von Jailbreaking?
  2. 2. Wer ist Pliny the Liberator?
  3. 3. Wie funktioniert ein „Crescendo“-Angriff?
  4. 4. Warum sind Jailbreaks schwer zu verhindern?
  5. 5. Was versteht man unter einem „Liebesangriff“?
  6. 6. Warum nennt Thilo Hagendorff Jailbreaking „angewandte Sozialpsychologie“?

Weiterlesen

B1 Sprachniveau ändern C1