Glossareintrag
Wir denken. KI tippt mit.
Mixture of Experts (kurz MoE, auf Deutsch sinngemäß Experten-Modell oder Expertenmischung) ist eine Bauweise für AI-/KI-Modelle, bei der das Modell intern aus vielen spezialisierten Teilnetzen besteht, den sogenannten Experten. Ein Verteiler im Modell, der Router, schickt jede Anfrage nur an die wenigen Experten, die dafür am besten geeignet sind. Der große Rest des Modells bleibt in diesem Moment untätig und verbraucht keine Rechenleistung.
Das Prinzip funktioniert wie ein großes Krankenhaus. Am Empfang entscheidet eine Fachkraft, zu welchen Spezialisten ein Patient geschickt wird, und kein Patient wird von allen Ärzten gleichzeitig behandelt. Genauso rechnet bei einem MoE-Modell nie das ganze Netz mit, sondern immer nur ein kleiner, passender Ausschnitt. Anbieter können dadurch riesige Modelle bauen, die trotzdem schnell und günstig antworten. Fast alle aktuellen Spitzenmodelle mit offenen Modellgewichten (Open Weights) nutzen diese Architektur, darunter DeepSeek, Metas Llama 4 und Kimi K3 aus China.
Technisch sitzt die MoE-Schicht in den Transformer-Blöcken eines Large Language Model (LLM). Dort ersetzt sie das sogenannte Feed-Forward-Netz, einen Baustein des neuronalen Netzwerks, durch viele parallele Kopien, eben die Experten. Der Router entscheidet für jeden einzelnen Token (Textbaustein) neu, welche Experten mitrechnen. Er wird beim Training mitgelernt und verbessert seine Zuteilung dadurch von selbst.
Entscheidend ist der Unterschied zwischen Gesamtparametern und aktiven Parametern. Das bekannte MoE-Modell Mixtral 8x7B von Mistral speichert zum Beispiel 46,7 Milliarden Parameter, pro Token rechnen aber nur 2 seiner 8 Experten, also rund 12,9 Milliarden Parameter. Das Modell antwortet deshalb ungefähr so schnell wie ein kleines 13-Milliarden-Modell, hat aber das Wissen und die Qualität eines viel größeren. Genau dieser Trick macht die Architektur so beliebt.
Die Idee ist deutlich älter als der aktuelle KI-Boom. Bereits 1991 beschrieben die Forscher Robert Jacobs, Michael Jordan, Steven Nowlan und Geoffrey Hinton das Grundprinzip aus mehreren Teilnetzen mit einem Verteiler. 2017 machte ein Google-Team um Noam Shazeer den Ansatz für große neuronale Netze praktisch nutzbar, und 2021 zeigte Googles Switch Transformer mit 1,6 Billionen Parametern über 2.048 Experten erstmals, wie weit sich MoE skalieren lässt. Den Durchbruch in die breite Praxis brachte im Dezember 2023 das französische Unternehmen Mistral mit dem frei verfügbaren Mixtral 8x7B. Eine anschauliche technische Einführung mit Grafiken bietet der englischsprachige Fachbeitrag „Mixture of Experts Explained" von Hugging Face.
Stand August 2026 setzen fast alle großen offenen Modelle auf MoE:
Bei den geschlossenen Diensten ist die Lage gemischt. Google hat Gemini 1.5 Pro im offiziellen Technikbericht als MoE-Modell bestätigt. Für GPT-4 kursiert seit 2023 das Gerücht von 16 Experten und rund 1,8 Billionen Parametern, OpenAI hat das aber nie bestätigt.
Die Architektur hat auch Nachteile. Der größte ist der Speicherbedarf, denn alle Experten müssen vollständig geladen sein, obwohl pro Token nur wenige rechnen. Mixtral 8x7B rechnet wie ein 13-Milliarden-Modell, braucht aber Speicher wie ein 47-Milliarden-Modell. Außerdem muss der Router die Arbeit gleichmäßig verteilen (Fachbegriff Load Balancing), sonst werden einzelne Experten überlastet, während andere nie dazulernen. Das Training ist dadurch spürbar komplizierter als bei klassischen, dichten Modellen.
Ein verbreitetes Missverständnis sollten Sie kennen. Die Experten sind keine Fachleute für Themen wie Recht, Medizin oder Handwerk und auch keine eigenständigen Chatbots. Ihre Spezialisierung entsteht beim Training von selbst und liegt eher auf abstrakten Mustern, etwa Satzzeichen, Zahlen oder Programmiercode. Mit Teams aus mehreren KI-Agenten oder zusammengeschalteten KI-Tools hat Mixture of Experts nichts zu tun.
Für Ihren Betrieb macht sich Mixture of Experts vor allem beim Preis bemerkbar. Die Kosten pro Anfrage richten sich bei KI-Diensten nach der tatsächlich eingesetzten Rechenleistung, also nach den aktiven Parametern und nicht nach der Gesamtgröße. Deshalb sind MoE-Modelle wie DeepSeek oder Kimi pro Anfrage auffällig günstig, und auch die großen Anbieter halten ihre Preise nur mit solchen Effizienz-Tricks stabil. Konkrete Zahlen zeigt unser Preisvergleich Claude vs. ChatGPT mit aktuellen API-Kosten.
Beim Vergleichen von KI-Modellen hilft Ihnen der Begriff, Werbeangaben richtig einzuordnen. Steht in einer Modellbezeichnung etwa „235B-A22B", bedeutet das 235 Milliarden Parameter gesamt, aber nur 22 Milliarden aktive. Die Zahl hinter dem A verrät also, wie viel Rechenleistung wirklich in jeder Antwort steckt.
Relevant wird MoE außerdem, wenn Sie ein offenes Modell aus Datenschutzgründen auf eigener Hardware betreiben wollen. Der Speicher muss immer für sämtliche Parameter reichen, auch für die gerade untätigen Experten. Kleine MoE-Modelle wie gpt-oss-20b laufen auf einem gut ausgestatteten Büro-PC, Riesen wie Kimi K3 dagegen nur auf Rechenzentrums-Technik. Für die meisten kleinen Betriebe bleibt darum der normale Weg über Abo oder API die praktischere Wahl, und dort profitieren Sie von der MoE-Effizienz automatisch, ohne etwas einstellen zu müssen.