Latency

KI-Glossar

Latenz bezeichnet im KI-Kontext die Zeit, die ein Modell benötigt, um auf eine Anfrage zu antworten — von der Eingabe bis zur ersten oder vollständigen Ausgabe. Sie ist ein zentrales Kriterium für die Nutzbarkeit von KI-Anwendungen.

Kurzdefinition

Latenz (englisch: Latency) bezeichnet im KI-Kontext die Zeitspanne zwischen dem Absenden einer Anfrage und dem Empfang der Antwort. Bei Sprachmodellen wird unterschieden zwischen Time to First Token (TTFT) — wie lange bis das erste Wort erscheint — und der Gesamtzeit für die vollständige Antwort. Latenz wird von Modellgröße, Infrastruktur, Netzwerkverbindung und Auslastung des Anbieters beeinflusst.

Einfach erklärt

Wer mit einem KI-Chatbot arbeitet, erlebt Latenz als die Wartezeit auf die Antwort. Bei einfachen Anfragen vergehen oft Sekunden; bei komplexen oder sehr langen Antworten kann es länger dauern. Für den gelegentlichen Einsatz ist das kaum ein Problem — für Anwendungen mit vielen gleichzeitigen Nutzern oder in Echtzeitszenarios wird Latenz zum kritischen Faktor.

Für Unternehmen, die KI in produktive Prozesse einbetten, ist Latenz eine konkrete Anforderung: Ein Chatbot im Kundendienst muss innerhalb von zwei Sekunden antworten, ein Dokumentenanalyse-Tool darf ruhig 20 Sekunden brauchen. Diese Anforderungen beeinflussen die Wahl von Modell, Infrastruktur und Architektur.

Beispiel aus dem Arbeitsalltag

Ein E-Commerce-Unternehmen integriert einen KI-gestützten Produktberater auf der Website. Tests zeigen: Das große Cloud-Modell braucht im Schnitt 8 Sekunden für eine Antwort — Nutzer brechen den Chat ab. Das Team wechselt auf ein kleineres, schnelleres Modell mit 1,5 Sekunden Latenz. Die Nutzungsrate des Beraters steigt deutlich.

Warum ist der Begriff wichtig?

Latenz ist neben Qualität und Kosten das dritte Hauptkriterium bei der Auswahl und dem Betrieb von KI-Systemen. Wer nur auf Qualität schaut, riskiert unbrauchbare Antwortzeiten im Produktivbetrieb.

Mit zunehmender Automatisierung und Echtzeitanwendungen wird Latenz immer wichtiger. KI-Agenten, die mehrere Schritte hintereinander ausführen, summieren Latenz über viele Einzelaufrufe auf.

Chancen

  • Optimierungen wie Quantisierung und Caching können Latenz erheblich senken
  • Klare Latenzanforderungen helfen bei der begründeten Modellauswahl
  • Streaming-Ausgabe verbessert wahrgenommene Geschwindigkeit deutlich
  • Lokale Modelle eliminieren Netzwerk-Latenz für kritische Anwendungen

Risiken und typische Fehler

  • Hohe Latenz bei skalierenden Nutzerzahlen kann System unbrauchbar machen
  • Latenz variiert je nach Auslastung des Anbieters — keine Garantie ohne SLA
  • Latenz und Qualität stehen oft im Zielkonflikt: schneller bedeutet oft kleiner
  • Latenz in Agentic-AI-Systemen summiert sich über viele Modellaufrufe

Verwandte Begriffe

Passende Inhalte im KI College