Glossareintrag

Was bedeutet
Quantisierung (AI/KI-Modelle verkleinern)?

Veröffentlicht: 13/08/2026
Aktualisiert: 28/08/2026

Wir denken. KI tippt mit.

Quantisierung (AI/KI-Modelle verkleinern)

Definition:

Quantisierung (englisch quantization) ist ein Verfahren, das AI-/KI-Modelle verkleinert, indem es deren Parameter mit geringerer Zahlengenauigkeit speichert, zum Beispiel mit 4 statt 16 Bit pro Wert. Das Modell behält dabei alle seine Parameter und sein gesamtes Wissen, jeder einzelne Zahlenwert wird nur gröber gerundet abgelegt. Ein Large Language Model (LLM) mit 7 bis 8 Milliarden Parametern schrumpft so von 14 bis 16 GB auf rund 5 GB und läuft damit auf einem normalen Büro- oder Gaming-PC statt nur auf Rechenzentrums-Hardware.

Das Prinzip ähnelt der Kompression bei digitalen Fotos/Bildern. Ein JPEG speichert Farben ungenauer als das Rohformat der Kamera, für das Auge bleibt das Bild fast identisch, die Datei ist aber nur einen Bruchteil so groß. Genauso speichert ein quantisiertes KI-Modell seine Zahlenwerte ungenauer und antwortet trotzdem beinahe so gut wie das Original.

Praktisch wichtig ist Quantisierung vor allem für lokale KI. Sie macht leistungsfähige Sprachmodelle klein genug, um auf eigener Hardware zu laufen, ohne Cloud, ohne laufende Gebühren und ohne dass Daten das Haus verlassen.

Beschreibung:

Ausgangspunkt ist die Art, wie ein fertig trainiertes Modell seine Parameter speichert, üblicherweise als 16-Bit-Fließkommazahlen (Formate wie FP16 oder BF16), also 2 Byte pro Wert. Die Quantisierung rechnet diese Werte in kompaktere Formate um, meist ganze Zahlen mit 8 oder 4 Bit. Wie stark das die Dateigröße drückt, zeigen die offiziellen Downloads von Googles offenem Modell Gemma 3 in der Ollama-Bibliothek am Beispiel der 27-Milliarden-Parameter-Version:

  • 16 Bit (FP16), das Original: 55 GB, braucht Profi-Hardware
  • 8 Bit (Q8_0): 30 GB, praktisch kein messbarer Qualitätsverlust
  • 4 Bit (Q4_K_M): 17 GB, der übliche Kompromiss aus Größe und Qualität
  • 2 Bit (Q2_K): nochmals kleiner, aber mit deutlich spürbaren Qualitätseinbußen, eher Notlösung

Damit ist auch das kryptische Namensschema erklärt, das beim Herunterladen von Modellen überall auftaucht. In einem Kürzel wie Q4_K_M steht Q für Quantisierung, die Zahl für die Bits pro Parameter (bei den K-Varianten als Durchschnittswert), und die Buchstaben dahinter bezeichnen die Untervariante (K für die moderne „K-Quant"-Methode von llama.cpp, M für die mittlere Ausführung). Als Merkregel gilt, je höher die Zahl hinter dem Q, desto größer die Datei und desto näher am Original.

Beim Qualitätsverlust lohnt ein ehrlicher Blick. In Benchmark-Messungen verliert eine 4-Bit-Version gegenüber dem Original meist nur wenige Prozentpunkte, im Alltag fällt der Unterschied oft gar nicht auf. Die Antworten können sich aber im Wortlaut ändern, und Nutzer berichten, dass Schwächen oft zuerst bei anspruchsvollen Logik- und Rechenaufgaben auffallen, was Durchschnittswerte aus Benchmarks teilweise verdecken. Wer ein Modell für solche Aufgaben nutzt und genug Speicher hat, greift deshalb besser zu Q6 oder Q8.

Verteilt werden quantisierte Modelle überwiegend im Dateiformat GGUF, das vom Open-Source-Projekt llama.cpp stammt und von Tools wie Ollama und LM Studio gelesen wird. Daneben existieren Verfahren für Entwickler mit GPU-Servern, etwa GPTQ, AWQ und bitsandbytes. Die Forschung treibt die Kompression noch weiter, Microsoft experimentiert mit BitNet an Modellen mit nur 1,58 Bit pro Parameter, und der Anbieter Unsloth presst mit dynamischer Quantisierung selbst Riesenmodelle zusammen. Das chinesische Modell Kimi K3 mit 2,8 Billionen Parametern schrumpft dabei von rund 1,56 Terabyte auf 594 GB, bleibt für normale PCs aber trotzdem außer Reichweite.

Zur Einordnung hilft die Abgrenzung von drei verwandten Techniken. Pruning entfernt überflüssige Parameter komplett, Destillation trainiert ein kleines Schülermodell auf die Antworten eines großen Lehrermodells, und Fine-Tuning verändert das Verhalten eines Modells, nicht seine Größe. Quantisierung ist von diesen Ansätzen der mit Abstand einfachste, denn sie kommt ohne teures Neutraining aus.

Quantisierung (AI/KI-Modelle verkleinern) für Unternehmen und Handwerker:

Für lokale Unternehmen und Handwerksbetriebe ist Quantisierung die Technik, die eine eigene, lokal laufende KI überhaupt erst möglich macht. Wer ChatGPT, Claude oder Gemini in der Cloud nutzt, muss sich mit dem Begriff nie beschäftigen. Relevant wird er, sobald ein Sprachmodell auf dem eigenen Rechner laufen soll, etwa weil Angebotstexte, Kalkulationen oder Kundendaten den Betrieb nicht verlassen dürfen oder weil monatliche KI-Gebühren entfallen sollen.

In der Praxis begegnet Ihnen Quantisierung direkt in den beiden verbreitetsten Programmen für lokale KI. Das kostenlose Tool Ollama lädt beim einfachen Herunterladen eines Modells in aller Regel automatisch die 4-Bit-Variante Q4_K_M, andere Stufen wählen Sie über ein Kürzel hinter dem Modellnamen. In der Ollama-Modellbibliothek sehen Sie zu jedem Modell die verfügbaren Quantisierungsstufen samt Dateigröße in GB. LM Studio geht noch einen Schritt weiter, zeigt zu jedem Modell eine Auswahlliste der Varianten, hebt die zur eigenen Hardware passende hervor und schätzt den Speicherbedarf ab.

Welche Modellgröße auf welchem Rechner läuft, lässt sich mit Faustregeln abschätzen (jeweils bezogen auf die übliche 4-Bit-Stufe):

  • Büro-PC mit 16 GB Arbeitsspeicher: Modelle mit 7 bis 8 Milliarden Parametern, rund 5 GB Download
  • Gaming-PC mit 8-GB-Grafikkarte: dieselbe Modellklasse, aber mit deutlich schnelleren Antworten
  • 32 GB Arbeitsspeicher oder 12 bis 16 GB Grafikspeicher: Modelle mit 12 bis 14 Milliarden Parametern
  • Modelle ab etwa 27 Milliarden Parametern: brauchen für flüssigen Betrieb rund 24 GB Grafikspeicher, also Workstation-Klasse

Als Startpunkt hat sich die Standardstufe Q4_K_M bewährt. Wirken die Antworten bei Ihren Aufgaben unzuverlässig, testen Sie dasselbe Modell in Q6 oder Q8, sofern der Speicher reicht. Von Q2-Versionen raten Messungen der llama.cpp-Community ab, dort bricht die Qualität deutlich ein, und auch Q3 gilt nur als Notlösung für knappen Speicher. Ein kleineres Modell in hoher Qualitätsstufe liefert häufig bessere Ergebnisse als ein großes Modell, das auf 2 Bit zusammengepresst wurde.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?