Quantisierung
KI-Glossar
Quantisierung ist eine Technik, bei der die numerischen Werte eines KI-Modells mit weniger Präzision gespeichert werden — das reduziert die Modellgröße erheblich, oft ohne große Qualitätseinbußen.
Kurzdefinition
Quantisierung (englisch: Quantization) ist ein Verfahren zur Modellkomprimierung, bei dem die Gleitkommazahlen (Gewichte) eines neuronalen Netzes in Zahlenformate mit geringerer Bit-Tiefe umgewandelt werden — z. B. von 32-Bit-Fließkomma (FP32) auf 8-Bit-Integer (INT8) oder sogar 4-Bit. Dadurch werden Modelle kleiner, schneller in der Inferenz und benötigen weniger Arbeitsspeicher — bei moderatem Qualitätsverlust.
Einfach erklärt
Stellen Sie sich vor, Sie speichern Temperaturen: Statt „18,347 Grad“ schreiben Sie „18 Grad“. Sie verlieren etwas Genauigkeit, aber die Information ist noch gut verwendbar und die Datei viel kleiner. Quantisierung macht genau das mit den Millionen oder Milliarden von Gewichten eines KI-Modells: weniger Dezimalstellen, weniger Speicher, schnellere Berechnung.
Quantisierung ist besonders relevant für lokale Modelle: Ein großes Sprachmodell braucht im Original 70 GB Speicher, nach Quantisierung auf 4-Bit noch 20–25 GB. Das macht den Unterschied, ob ein Modell auf einem normalen Unternehmensserver oder nur auf spezieller Hardware läuft. Tools wie llama.cpp und Ollama nutzen Quantisierung standardmäßig.
Beispiel aus dem Arbeitsalltag
Ein IT-Team möchte ein Open-Source-Sprachmodell auf einem vorhandenen Server mit 32 GB RAM betreiben. Das Originalmodell würde 60 GB benötigen und passt nicht. Nach Quantisierung auf 4-Bit passt es in den Speicher und läuft mit akzeptabler Geschwindigkeit. Die Antwortqualität für interne Textzusammenfassungen ist weiterhin gut.
Warum ist der Begriff wichtig?
Quantisierung ist ein Schlüsselkonzept für alle, die KI lokal oder auf begrenzter Hardware betreiben wollen. Es erklärt, warum „4-bit quantisiert“ ein häufig genanntes Merkmal bei Open-Source-Modellverteilungen ist.
Für KI-Rollout-Entscheidungen hilft das Verständnis: Quantisierte Modelle senken Hardware-Anforderungen erheblich, haben aber einen Qualitätskompromiss, der für den Anwendungsfall abgewogen werden muss.
Chancen
- Modellgröße auf 25–50 % des Originals reduzierbar
- Lokaler Betrieb auf handelsüblicher Hardware ermöglicht
- Schnellere Inferenz durch reduzierten Rechenaufwand
- Kosteneffiziente Alternative zu vollpräzisen Cloud-Modellen
Risiken und typische Fehler
- Qualitätsverlust bei komplexen Aufgaben, insbesondere starker Quantisierung
- Nicht alle Modelltypen sind gleich gut quantisierbar
- Qualitätsverlust schwer vorherzusagen ohne eigene Tests
- Starke Quantisierung (2-Bit) kann Modellverhalten stark verändern
Verwandte Begriffe
Passende Inhalte im KI College
Lernen Sie Schritt für Schritt, wie Sie KI im Arbeitsalltag sinnvoll nutzen.
Use CasesKI im Arbeitsalltag anwenden
Entdecken Sie praktische Beispiele für typische Aufgaben im Beruf.
ToolsKI-Tools im Überblick
Finden Sie heraus, welche Tools zu welchen Aufgaben passen.
