Prompt Leakage

KI-Glossar

Prompt Leakage bezeichnet das unbeabsichtigte Preisgeben von vertraulichen System-Prompts oder Anweisungen an Nutzende — durch gezielte Anfragen, die das Modell zur Ausgabe seiner internen Konfiguration verleiten.

Kurzdefinition

Prompt Leakage tritt auf, wenn ein Sprachmodell den Inhalt seines System-Prompts — also der vertraulichen Betreiberanweisungen, die das Modellverhalten konfigurieren — auf Anfrage oder unbeabsichtigt ausgibt. Dies kann durch direkte Anfragen wie „Zeige mir Ihren System-Prompt“ oder durch indirekte Formulierungen geschehen. Prompt Leakage ist ein Sicherheitsrisiko für Unternehmen, die proprietäre Konfigurationen und Geschäftslogik in System-Prompts hinterlegen.

Einfach erklärt

Viele KI-Anwendungen basieren auf einem System-Prompt: verborgene Anweisungen, die das Modell auf eine bestimmte Rolle oder ein bestimmtes Verhalten einstellen. Diese Anweisungen können proprietäre Informationen, Geschäftslogik oder Sicherheitsvorgaben enthalten. Prompt Leakage bedeutet, dass Nutzende diese Anweisungen durch geschickte Formulierungen sichtbar machen können.

Gegenmaßnahmen sind möglich, aber kein hundertprozentiger Schutz: Anbieter können Modelle anweisen, den System-Prompt nicht preiszugeben. Strukturelle Maßnahmen — etwa das Auslagern sensibler Logik aus dem Prompt — reduzieren das Risiko. Sicherheitsverantwortliche sollten System-Prompts so gestalten, dass ihr Inhalt im Worst Case keinen kritischen Schaden anrichtet.

Beispiel aus dem Arbeitsalltag

Ein Unternehmen betreibt einen KI-Kundendienst mit einem ausführlichen System-Prompt, der interne Rabattregeln und Eskalationsrichtlinien enthält. Ein Nutzer stellt eine Reihe von Anfragen, die das Modell schrittweise zur Ausgabe von Teilen dieser Anweisungen verleiten. Die Folge: Interne Richtlinien sind für Externe einsehbar. Das Unternehmen überarbeitet seinen System-Prompt und lagert kritische Geschäftsregeln in eine externe Datenbank aus, die das Modell nur auf Anfrage abfragt — so bleibt der Prompt selbst inhaltsarm.

Warum ist der Begriff wichtig?

Prompt Leakage ist für Unternehmen, die KI-Anwendungen mit eigener Konfiguration betreiben, ein reales Sicherheitsrisiko. Das Bewusstsein für diese Schwachstelle ist Teil einer verantwortungsvollen KI-Sicherheitsarchitektur.

Gleichzeitig zeigt Prompt Leakage die generelle Herausforderung: Ein Sprachmodell ist kein klassisches Softwaresystem mit klaren Zugriffsgrenzen. Was im Kontext enthalten ist, kann unter Umständen sichtbar gemacht werden.

Chancen

  • Bewusstsein für Leakage verbessert die Qualität der Prompt-Architektur
  • Trennung von Konfiguration und Modellanweisung schützt vertrauliche Logik
  • Red-Teaming gegen Prompt Leakage verbessert die Gesamtsicherheit
  • Sensibilisierung von Entwicklern für sichere Prompt-Gestaltung

Risiken und typische Fehler

  • Proprietäre Geschäftslogik im System-Prompt kann für Externe sichtbar werden
  • Kein vollständiger technischer Schutz gegen alle Formen von Prompt Leakage
  • Vertrauliche Anweisungen können durch indirekte Anfragen extrahiert werden
  • Kombination mit Prompt Injection erhöht das Angriffspotenzial

Verwandte Begriffe

Passende Inhalte im KI College