Ox Alpha KI Rätsel:
Chinas Rätsel-KI heißt GLM-5.3-Flash

Veröffentlicht: 01/09/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Schulte_Markus_300x300px

Markus Schulte

AI Solution Development, Autor

Inhaltsverzeichnis
Teilen
AI Newsletter

Das Rätselraten um Ox Alpha ist beendet. Das chinesische KI-Labor Z.ai hat am 26. August 2026 bestätigt, dass hinter dem anonymen Gratis-Modell sein neues GLM-5.3-Flash steckt. Eine Woche lang hatte das Modell ohne Absender die Nutzungscharts der KI-Plattform OpenRouter angeführt, während die Szene über die Herkunft spekulierte. Die Modellgewichte stehen unter MIT-Lizenz zum Download auf Hugging Face bereit. Der API-Preis liegt bei einem Bruchteil vergleichbar starker Konkurrenz, und der Testbetrieb lief nach Firmenangaben komplett auf chinesischen KI-Chips.

Die Enthüllung bestätigte den Verdacht, den viele Beobachter von Anfang an hatten. Z.ai galt als Hauptverdächtiger, seit Tokenizer-Analysen auf die GLM-Modellfamilie deuteten. Für Verwirrung sorgten stattdessen Google-Mitarbeiter, deren Andeutungen auf X tagelang die falsche Spur zu Gemini legten.

Beitragskopf der GLM-5.3-Flash Ankündigung im offiziellen Z.ai-Blog vom 26. August 2026 mit dem Titel Frontier Intelligence, Flash Cost
Beitragskopf des offiziellen Z.ai-Blogbeitrags zu GLM-5.3-Flash, veröffentlicht am 26. August 2026 in der Rubrik Research. (Quelle: https://z.ai/blog/glm-5.3-flash)

Über 11 Billionen Tokens in drei Tagen: Rekord-Start auf OpenRouter

Ox Alpha legte den größten Modell-Start in der Geschichte von OpenRouter hin. Laut der Plattform verarbeitete das Modell in den ersten drei vollen Tagen 11,6 Billionen Tokens, rund das 2,6-Fache des bisherigen Rekords. Am 24. August meldete OpenRouter auf X fast 6 Billionen Tokens an einem einzigen Tag.

Aufgetaucht war das Modell am 20. August 2026, gelistet als stealth/ox-alpha auf OpenRouter und im Open-Source-Coding-Agenten OpenCode. Das Kontextfenster fasst gut 1 Million Tokens, als Eingabe akzeptiert das Modell Text, Bilder und Video. OpenRouter beschrieb es als Reasoning-Modell für Coding und dauerhafte Agenten-Arbeit, entwickelt von einem Anbieter, „der anonym bleiben möchte“. In der Wochenrangliste setzte sich Ox Alpha gegen 558 gelistete Modelle durch und verwies DeepSeek auf Platz 2. Über die ganze Gratis-Woche summierte sich das Volumen laut dem Fachdienst heise online auf rund 23 Billionen Tokens.

0
Modelle in der OpenRouter-Wochenrangliste, Ox Alpha holte Platz 1
0
Millionen Anfragen verarbeitete das Modell allein am 25. August
0
Milliarden Parameter stecken in GLM-5.3-Flash
0
Punkte im Intelligence Index von Artificial Analysis

Die Bedingungen des Stealth-Programms erlauben dem anonymen Anbieter laut einer Analyse von heise online zu Ox Alpha, alle Eingaben für Training und Auswertung zu verwenden. Die Modellseite von Ox Alpha versprach zwar das Gegenteil, heise online wies aber auf den Widerspruch zu diesen Programm-Bedingungen hin. Wer das Modell in der Testwoche mit Firmencode oder Kundendaten fütterte, hat diese Daten an einen damals unbekannten Empfänger übertragen. Heute ist klar, dass sie an ein Unternehmen in Peking gingen.

Wer steckt hinter Ox Alpha? Google legte eine falsche Fährte

Während der Rätselwoche lenkten ausgerechnet Google-Mitarbeiter den Verdacht auf das eigene Unternehmen. Mehrere Beschäftigte von Google und DeepMind posteten ab dem 21. August vieldeutige Andeutungen auf X. Beobachter wie der KI-Kommentator CG fragten daraufhin öffentlich: „Ox Alpha ist Gemini?“ Nach der Enthüllung erklärte Googles Entwickler-Sprecher Logan Kilpatrick, die Posts hätten sich auf den Erfolg des kurz zuvor gestarteten Gemini 3.7 Flash bezogen, und sprach von einem unglücklichen Zusammentreffen der Termine.

Die entscheidenden Hinweise kamen aus technischen Analysen. Der Suchmaschinen-Analyst Dan Petrovic verglich die Antworten von Ox Alpha per Kompressions-Verfahren mit knapp 300 Referenztexten und veröffentlichte das Ergebnis am 23. August unter dem Titel „Ox Alpha is GLM“. Einen Tag später legte das Sicherheitsunternehmen CTGT ein Verhaltens-Fingerprinting zur Herkunft von Ox Alpha nach. Alle 11 Tokenizer-Proben, von Emojis bis zu koreanischer Schrift, passten exakt zur GLM-Familie, und der Endpoint gab eine Fehlermeldung im Z.ai-typischen Format aus. Zur Spur passte die Vorgeschichte, denn OpenRouter hatte schon früher anonyme Modelle unter Codenamen wie „Hunter Alpha“ getestet, hinter denen sich chinesische Anbieter verbargen.

DatumEreignis
20.08.2026Ox Alpha erscheint anonym und kostenlos auf OpenRouter und im Coding-Agenten OpenCode
21.08.2026Rund 2 Billionen Tokens an einem Tag, erste Google-Andeutungen auf X; Stripe-Chef Patrick Collison nennt das Modell „sehr beeindruckend“
22.08.2026Die Spekulation „Ox Alpha ist Gemini“ macht die Runde
23.08.2026TechCrunch fragt „Wer steckt hinter Ox Alpha?“; Analyst Dan Petrovic veröffentlicht „Ox Alpha is GLM“
24.08.2026OpenRouter meldet fast 6 Billionen Tokens an einem Tag; CTGT veröffentlicht Verhaltens-Fingerprinting
25.08.2026Platz 1 der OpenRouter-Wochenrangliste vor DeepSeek, 558 gelistete Modelle
26.08.2026Z.ai bestätigt die Urheberschaft gegenüber Bloomberg und veröffentlicht GLM-5.3-Flash samt Gewichten
27.08.2026Die Aktie des Mutterunternehmens Zhipu legt an der Börse Hongkong deutlich zu

Was ist ein Stealth-Modell?

Ein Stealth-Modell ist ein KI-Modell, das ein Anbieter vor dem offiziellen Start anonym unter einem Codenamen testet. Plattformen wie OpenRouter stellen es kostenlos bereit, im Gegenzug darf der Anbieter die Eingaben der Nutzer auswerten und für das Training verwenden. Der Hersteller erhält so ehrliches Feedback unter Volllast, ohne dass sein Markenname die Urteile färbt. Frühere Codenamen wie „Hunter Alpha“ und „Healer Alpha“ entpuppten sich als Modelle des chinesischen Konzerns Xiaomi.

Die Auflösung: 320 Milliarden Parameter unter MIT-Lizenz

GLM-5.3-Flash ist das erste nativ multimodale Modell der GLM-5-Serie und verarbeitet Text, Bilder und Video in einem Kontextfenster von 1 Million Tokens. Technisch handelt es sich um ein Mixture-of-Experts-Modell mit 320 Milliarden Parametern, von denen pro Antwort nur 18 Milliarden aktiv rechnen. Z.ai kombiniert dafür laut der offiziellen Ankündigung zu GLM-5.3-Flash erstmals Sparse Attention mit Linear Attention. Verglichen mit dem großen Schwestermodell GLM-5.3 sinkt der Rechenaufwand für die Aufmerksamkeits-Schicht um den Faktor 3, der Zwischenspeicher schrumpft um den Faktor 4,4.

Die Modellgewichte stehen als Open Weights unter der besonders freien MIT-Lizenz auf Hugging Face bereit, auch die kommerzielle Nutzung ist erlaubt. Bis Ende August zählte die Plattform bereits über 379.000 Downloads. In den selbst veröffentlichten Benchmarks rückt das kleine Modell nah an die teuersten Systeme des Marktes heran, in einzelnen Tests zieht es vorbei.

BenchmarkGLM-5.3-FlashDeepSeek-V4-Vision-ExpClaude Opus 4.8GPT-5.6 Terra
Terminal Bench 2.1 (Coding-Agent)84,383,985,087,4
DeepSWE v1.1 (Software-Aufgaben)63,459,358,069,6
Toolathlon Verified (Werkzeug-Nutzung)78,475,976,274,9
AutomationBench v1.0.648,838,841,037,2
GDPval-AA v2 (Elo-Wertung)1773167515821571

Die Zahlen stammen aus Z.ais eigener Veröffentlichung und sind nicht unabhängig bestätigt. heise online verwies während der Testwoche auf eine deutlich niedrigere DeepSWE-Messung von 58,4 Prozent für Ox Alpha, während in sozialen Netzwerken höhere Werte kursierten. Z.ai-Mitarbeiter Zixuan Li erklärte dazu auf X, Ox Alpha sei eine frühe Version gewesen, die offizielle Fassung liefere mehr Leistung und deutlich bessere Stabilität.

Screenshot der GLM-5.3-Flash Hugging Face Model Card mit rot markierter MIT-Lizenz und der Safetensors-Angabe 321B params
Model Card von GLM-5.3-Flash auf Hugging Face: MIT-Lizenz und 379.271 Downloads im letzten Monat. Die rot markierten 321B params sind die reine Dateizählung der Gewichte, Z.ai bezeichnet das Modell als 320B-A18B. (Quelle: https://huggingface.co/zai-org/GLM-5.3-Flash)

Frontier-Niveau für 9 Cent pro Aufgabe

Der unabhängige Bewertungsdienst Artificial Analysis misst für GLM-5.3-Flash 57 Punkte im Intelligence Index und damit Rang 4 von 111 geprüften Modellen. Das Modell sitze „bequem an der Pareto-Front“ aus Intelligenz und Kosten pro Aufgabe, so der Dienst. Die stärksten Systeme des Marktes liegen 3 bis 6 Punkte darüber: Claude Opus 5 erreicht 63 Punkte, Claude Fable 5 kommt auf 62, GPT-5.6 Sol und Grok 4.6 auf 61.

Balkendiagramm des Artificial Analysis Intelligence Index, GLM-5.3-Flash blau markiert mit 57 Punkten neben elf weiteren KI-Modellen
Der GLM-5.3-Flash Intelligence Index liegt laut Artificial Analysis bei 57 Punkten, die Spitze erreicht 63. (Quelle: https://artificialanalysis.ai/models/glm-5-3-flash)

Interessant wird der Vergleich beim Preis. Für eine Aufgabe des Index berechnet Artificial Analysis bei GLM-5.3-Flash 0,09 Dollar, bei GPT-5.6 Sol dagegen 0,95 Dollar. Für 4 Indexpunkte mehr zahlen Kunden also mehr als das Zehnfache, was Z.ais Werbeaussage zur zehnfach teureren Intelligenzklasse stützt. Noch deutlicher wird es bei gleichem Punktwert. Metas Muse Spark 1.2 erreicht ebenfalls 57 Punkte, kostet pro Aufgabe aber 0,40 Dollar, also das Viereinhalbfache. Mit dem Startrabatt sinkt der Preis von GLM-5.3-Flash sogar auf 0,045 Dollar pro Aufgabe.

Kosten pro Aufgabe im Modellvergleich

Gewichtete Durchschnittskosten in US-Dollar pro Aufgabe des Intelligence Index, Vergleichsauswahl von Artificial Analysis. Der Punktwert im Index steht in Klammern hinter dem Modellnamen: niedrige Kosten sind gut, hohe Punktzahl auch.

Quelle: Artificial Analysis, Modellseite zu GLM-5.3-Flash, Stand 31.08.2026. Gemessen jeweils in der stärksten Einstellung des Modells, Kosten als gewichteter Durchschnitt über die Aufgaben des Index.
Zahlen als Tabelle
ModellIndexpunkteKosten pro Aufgabe
GPT-5.6 Luna520,05 $
GLM-5.3-Flash570,09 $
DeepSeek V4 Pro 0813530,27 $
Nemotron 3 Ultra380,38 $
Muse Spark 1.2570,40 $
Gemini 3.7 Flash560,40 $
GLM-5.3600,68 $
Kimi K3600,84 $
Grok 4.6610,94 $
GPT-5.6 Sol610,95 $
Claude Opus 5632,34 $
Claude Fable 5623,14 $

Das billigste Modell des Feldes ist GLM-5.3-Flash allerdings nicht. GPT-5.6 Luna kostet mit 0,05 Dollar pro Aufgabe noch weniger, erreicht im Index aber nur 52 Punkte. DeepSeek V4 Pro liegt bei 0,27 Dollar und 53 Punkten, Nvidias Nemotron 3 Ultra sogar bei 0,38 Dollar für 38 Punkte. Günstiger als GLM-5.3-Flash ist in dieser Auswahl also nur, wer beim Können zurücksteckt.

Auch die reinen API-Preise unterbieten die westliche Konkurrenz deutlich. Der Listenpreis liegt bei 0,15 Dollar pro Million Eingabe-Tokens und 0,50 Dollar pro Million Ausgabe-Tokens. Bis zum 9. September 2026 gilt ein Einführungsrabatt von 50 Prozent. Über OpenRouter bieten heute 21 Anbieter das Modell an, und wer den Coding-Abo-Tarif von Z.ai nutzt, erhält GLM-5.3-Flash mit dem Dreifachen des bisherigen Kontingents. Das offene chinesische Konkurrenzmodell Kimi K3 von Moonshot AI erreicht zwar 3 Indexpunkte mehr, ist mit 2,8 Billionen Parametern aber fast neunmal so groß und kostet pro Aufgabe das gut Neunfache.

100.000 chinesische Chips, und niemand nennt den Hersteller

Nach Angaben von Z.ai lief der gesamte Ox-Alpha-Verkehr, also Billionen Tokens pro Tag, auf einem Cluster aus rund 100.000 in China produzierten KI-Chips. Die Inferenz-Software dafür hat Z.ai auf Basis des Open-Source-Frameworks SGLang selbst entwickelt und nach eigenen Angaben die Leistung des Systems auf derselben Hardware verdreifacht. Kosten pro Token und Effizienz seien damit „vergleichbar mit gängigen Nvidia-GPUs“.

Unabhängig überprüfen lässt sich das bisher nicht. Der US-Sender CNBC konnte die Chip-Angaben nach eigener Aussage nicht verifizieren, einen Hersteller nennt Z.ai nicht. Beobachter halten Beschleuniger von Huawei für die wahrscheinlichste Grundlage, belegt ist das nicht. Z.ai steht seit Januar 2025 auf der Entity List der US-Regierung und hat damit keinen legalen Zugang zu den stärksten Nvidia-Chips. Schon das große Sprachmodell GLM-5 will das Unternehmen komplett auf Huawei-Ascend-Hardware trainiert haben. Der deutsche Fachdienst The Decoder bringt den Fall in seiner Analyse zu GLM-5.3-Flash auf die Formel, das Modell laufe „ohne Nvidia“ und koste „einen Bruchteil der Konkurrenz“.

Z.ai: Vom Tsinghua-Ableger zum ersten Börsengang der KI-Tiger

Z.ai firmierte bis Juli 2025 international unter dem Namen Zhipu AI. Gegründet wurde das Unternehmen 2019 als Ausgründung der Tsinghua-Universität in Peking. Die GLM-Reihe zählt seit Jahren zu den stärksten offenen Modellfamilien, die Version GLM-4.6 etablierte sich 2025 als günstige Coding-Alternative. Als erstes der als „KI-Tiger“ bekannten chinesischen KI-Start-ups wagte das Unternehmen am 8. Januar 2026 den Börsengang in Hongkong, bei einer Bewertung von umgerechnet rund 7,1 Milliarden US-Dollar.

An der Börse Hongkong legte die Aktie laut CNBC am Tag nach der Bekanntgabe rund 8 Prozent zu, zum Handelsschluss meldete die South China Morning Post sogar über 12 Prozent Plus. Der halbierte Einführungspreis für die API gilt noch bis zum 9. September 2026.

ChatGPT für Handwerker &
Unternehmen

Holen Sie sich jetzt kostenlos die besten ChatGPT Prompts für lokale Dienstleister wie z.B. Handwerker. Sie werden damit bei Preisverhandlungen siegen können und Gegenargumente entkräften. Viele Prompts und ein breites Spektrum an Themen, um Ihren Arbeitsalltag zu erleichtern. Laden Sie sich jetzt diese einmalige Prompt-Bibliothek speziell für regional tätige Unternehmen & Handwerksbetriebe herunter.

Webinar Release KI im Handwerk

Sie haben eine Frage?