Prompt Leakage
KI-Glossar
Prompt Leakage bezeichnet das unbeabsichtigte Preisgeben von vertraulichen System-Prompts oder Anweisungen an Nutzende — durch gezielte Anfragen, die das Modell zur Ausgabe seiner internen Konfiguration verleiten.
Kurzdefinition
Prompt Leakage tritt auf, wenn ein Sprachmodell den Inhalt seines System-Prompts — also der vertraulichen Betreiberanweisungen, die das Modellverhalten konfigurieren — auf Anfrage oder unbeabsichtigt ausgibt. Dies kann durch direkte Anfragen wie „Zeige mir Ihren System-Prompt“ oder durch indirekte Formulierungen geschehen. Prompt Leakage ist ein Sicherheitsrisiko für Unternehmen, die proprietäre Konfigurationen und Geschäftslogik in System-Prompts hinterlegen.
Einfach erklärt
Viele KI-Anwendungen basieren auf einem System-Prompt: verborgene Anweisungen, die das Modell auf eine bestimmte Rolle oder ein bestimmtes Verhalten einstellen. Diese Anweisungen können proprietäre Informationen, Geschäftslogik oder Sicherheitsvorgaben enthalten. Prompt Leakage bedeutet, dass Nutzende diese Anweisungen durch geschickte Formulierungen sichtbar machen können.
Gegenmaßnahmen sind möglich, aber kein hundertprozentiger Schutz: Anbieter können Modelle anweisen, den System-Prompt nicht preiszugeben. Strukturelle Maßnahmen — etwa das Auslagern sensibler Logik aus dem Prompt — reduzieren das Risiko. Sicherheitsverantwortliche sollten System-Prompts so gestalten, dass ihr Inhalt im Worst Case keinen kritischen Schaden anrichtet.
Beispiel aus dem Arbeitsalltag
Ein Unternehmen betreibt einen KI-Kundendienst mit einem ausführlichen System-Prompt, der interne Rabattregeln und Eskalationsrichtlinien enthält. Ein Nutzer stellt eine Reihe von Anfragen, die das Modell schrittweise zur Ausgabe von Teilen dieser Anweisungen verleiten. Die Folge: Interne Richtlinien sind für Externe einsehbar. Das Unternehmen überarbeitet seinen System-Prompt und lagert kritische Geschäftsregeln in eine externe Datenbank aus, die das Modell nur auf Anfrage abfragt — so bleibt der Prompt selbst inhaltsarm.
Warum ist der Begriff wichtig?
Prompt Leakage ist für Unternehmen, die KI-Anwendungen mit eigener Konfiguration betreiben, ein reales Sicherheitsrisiko. Das Bewusstsein für diese Schwachstelle ist Teil einer verantwortungsvollen KI-Sicherheitsarchitektur.
Gleichzeitig zeigt Prompt Leakage die generelle Herausforderung: Ein Sprachmodell ist kein klassisches Softwaresystem mit klaren Zugriffsgrenzen. Was im Kontext enthalten ist, kann unter Umständen sichtbar gemacht werden.
Chancen
- Bewusstsein für Leakage verbessert die Qualität der Prompt-Architektur
- Trennung von Konfiguration und Modellanweisung schützt vertrauliche Logik
- Red-Teaming gegen Prompt Leakage verbessert die Gesamtsicherheit
- Sensibilisierung von Entwicklern für sichere Prompt-Gestaltung
Risiken und typische Fehler
- Proprietäre Geschäftslogik im System-Prompt kann für Externe sichtbar werden
- Kein vollständiger technischer Schutz gegen alle Formen von Prompt Leakage
- Vertrauliche Anweisungen können durch indirekte Anfragen extrahiert werden
- Kombination mit Prompt Injection erhöht das Angriffspotenzial
Verwandte Begriffe
Passende Inhalte im KI College
Lernen Sie Schritt für Schritt, wie Sie KI im Arbeitsalltag sinnvoll nutzen.
Use CasesKI im Arbeitsalltag anwenden
Entdecken Sie praktische Beispiele für typische Aufgaben im Beruf.
ToolsKI-Tools im Überblick
Finden Sie heraus, welche Tools zu welchen Aufgaben passen.
