Glossareintrag
Wir denken. KI tippt mit.
Destillation (englisch Model Distillation oder Knowledge Distillation) ist ein Verfahren, bei dem ein großes AI-/KI-Modell als Lehrer ein deutlich kleineres Schüler-Modell trainiert. Das kleine Modell lernt dabei, die Antworten des großen nachzuahmen. Es erreicht so einen Großteil von dessen Leistung, braucht im Betrieb aber nur einen Bruchteil der Rechenleistung.
Destillierte Modelle antworten schneller, kosten weniger und laufen teils sogar auf einem normalen Laptop oder Smartphone statt im Rechenzentrum. Deshalb gehört Destillation heute bei praktisch allen großen KI-Anbietern zum Handwerkszeug. Sie sorgt aber auch für Streit, wenn ein Anbieter heimlich vom Modell eines Konkurrenten destilliert.
Die Grundidee stammt aus dem Forschungspapier „Distilling the Knowledge in a Neural Network", das Geoffrey Hinton mit zwei Google-Kollegen 2015 veröffentlichte. Ein großes neuronales Netzwerk oder ein Verbund mehrerer Modelle dient als Lehrer (Teacher), ein kleines Modell als Schüler (Student). Der Schüler wird nicht mühsam mit den ursprünglichen Trainingsdaten von Grund auf trainiert, sondern lernt direkt vom Verhalten des fertigen Lehrers.
Der Trick liegt darin, was der Schüler zu sehen bekommt. Zeigt man einem Bilderkennungs-Modell ein Wolfsfoto, sagt es intern nicht einfach „Wolf", sondern liefert Wahrscheinlichkeiten, etwa 90 Prozent Wolf, 9 Prozent Hund, 1 Prozent Katze. Diese weichen Antworten (Soft Labels) verraten dem Schüler zusätzlich, welche Kategorien einander ähneln, und genau dieses Zusatzwissen macht das Lernen so wirksam. Bei großen Sprachmodellen läuft es genauso, nur mit Wahrscheinlichkeiten für das jeweils nächste Token.
Daneben gibt es eine gröbere Variante, die ohne Blick ins Innere des Lehrers auskommt. Das große Modell erzeugt schlicht riesige Mengen Beispielantworten, mit denen das kleine Modell trainiert wird. So entstanden Anfang 2025 die bekannten DeepSeek-R1-Distill-Modelle. Das große R1 mit 671 Milliarden Parametern lieferte rund 800.000 Trainingsbeispiele, die kleinste destillierte Variante kommt mit 1,5 Milliarden Parametern aus.
Auch die großen Anbieter destillieren ganz offiziell. Google gibt an, seine schnellen Flash-Modelle per Destillation aus den großen Pro-Modellen zu gewinnen. OpenAI bietet Entwicklern seit Oktober 2024 eine eigene Destillations-Funktion in seiner API an. Amazon wirbt für die Destillation auf seiner Bedrock-Plattform mit Modellen, die um bis zu 75 Prozent günstiger und ein Vielfaches schneller arbeiten, bei nach Firmenangaben unter 2 Prozent Genauigkeitsverlust.
Destillation wird leicht mit anderen Verfahren verwechselt, die KI-Modelle kleiner oder passgenauer machen:
Für Schlagzeilen sorgt Destillation, wenn sie ungefragt über die Schnittstelle eines Konkurrenten läuft. OpenAI wirft DeepSeek seit Januar 2025 vor, massenhaft ChatGPT-Antworten abgefragt und damit die eigenen Modelle trainiert zu haben. Anthropic berichtete im Februar 2026 von rund 24.000 gefälschten Konten, über die chinesische Anbieter mehr als 16 Millionen Antworten des Modells Claude abgegriffen haben sollen. Auch zum chinesischen Modell Kimi K3 steht ein solcher Vorwurf im Raum, den unabhängige Forscher allerdings anzweifeln. Die Nutzungsbedingungen von OpenAI, Anthropic und anderen Anbietern verbieten ausdrücklich, mit den Antworten ihrer Modelle Konkurrenzmodelle zu trainieren. Bewiesen oder gerichtlich entschieden ist bislang keiner dieser Fälle.
Sie nutzen destillierte Modelle vermutlich längst, ohne es zu wissen. Die günstigen Varianten der großen KI-Dienste tragen Namenszusätze wie „Flash", „mini" oder „Haiku" und stecken hinter vielen kostenlosen Chatbots. Es sind bewusst klein gehaltene Schwestermodelle der teuren Spitzenmodelle, bei Google ist Destillation als Herstellungsweg der Flash-Modelle offiziell bestätigt.
Konkret lohnt sich das Wissen an drei Stellen: