Das Rätselraten um Ox Alpha ist beendet. Das chinesische KI-Labor Z.ai hat am 26. August 2026 bestätigt, dass hinter dem anonymen Gratis-Modell sein neues GLM-5.3-Flash steckt. Eine Woche lang hatte das Modell ohne Absender die Nutzungscharts der KI-Plattform OpenRouter angeführt, während die Szene über die Herkunft spekulierte. Die Modellgewichte stehen unter MIT-Lizenz zum Download auf Hugging Face bereit. Der API-Preis liegt bei einem Bruchteil vergleichbar starker Konkurrenz, und der Testbetrieb lief nach Firmenangaben komplett auf chinesischen KI-Chips.
Die Enthüllung bestätigte den Verdacht, den viele Beobachter von Anfang an hatten. Z.ai galt als Hauptverdächtiger, seit Tokenizer-Analysen auf die GLM-Modellfamilie deuteten. Für Verwirrung sorgten stattdessen Google-Mitarbeiter, deren Andeutungen auf X tagelang die falsche Spur zu Gemini legten.
Über 11 Billionen Tokens in drei Tagen: Rekord-Start auf OpenRouter
Ox Alpha legte den größten Modell-Start in der Geschichte von OpenRouter hin. Laut der Plattform verarbeitete das Modell in den ersten drei vollen Tagen 11,6 Billionen Tokens, rund das 2,6-Fache des bisherigen Rekords. Am 24. August meldete OpenRouter auf X fast 6 Billionen Tokens an einem einzigen Tag.
Aufgetaucht war das Modell am 20. August 2026, gelistet als stealth/ox-alpha auf OpenRouter und im Open-Source-Coding-Agenten OpenCode. Das Kontextfenster fasst gut 1 Million Tokens, als Eingabe akzeptiert das Modell Text, Bilder und Video. OpenRouter beschrieb es als Reasoning-Modell für Coding und dauerhafte Agenten-Arbeit, entwickelt von einem Anbieter, „der anonym bleiben möchte“. In der Wochenrangliste setzte sich Ox Alpha gegen 558 gelistete Modelle durch und verwies DeepSeek auf Platz 2. Über die ganze Gratis-Woche summierte sich das Volumen laut dem Fachdienst heise online auf rund 23 Billionen Tokens.
Die Bedingungen des Stealth-Programms erlauben dem anonymen Anbieter laut einer Analyse von heise online zu Ox Alpha, alle Eingaben für Training und Auswertung zu verwenden. Die Modellseite von Ox Alpha versprach zwar das Gegenteil, heise online wies aber auf den Widerspruch zu diesen Programm-Bedingungen hin. Wer das Modell in der Testwoche mit Firmencode oder Kundendaten fütterte, hat diese Daten an einen damals unbekannten Empfänger übertragen. Heute ist klar, dass sie an ein Unternehmen in Peking gingen.
Wer steckt hinter Ox Alpha? Google legte eine falsche Fährte
Während der Rätselwoche lenkten ausgerechnet Google-Mitarbeiter den Verdacht auf das eigene Unternehmen. Mehrere Beschäftigte von Google und DeepMind posteten ab dem 21. August vieldeutige Andeutungen auf X. Beobachter wie der KI-Kommentator CG fragten daraufhin öffentlich: „Ox Alpha ist Gemini?“ Nach der Enthüllung erklärte Googles Entwickler-Sprecher Logan Kilpatrick, die Posts hätten sich auf den Erfolg des kurz zuvor gestarteten Gemini 3.7 Flash bezogen, und sprach von einem unglücklichen Zusammentreffen der Termine.
Die entscheidenden Hinweise kamen aus technischen Analysen. Der Suchmaschinen-Analyst Dan Petrovic verglich die Antworten von Ox Alpha per Kompressions-Verfahren mit knapp 300 Referenztexten und veröffentlichte das Ergebnis am 23. August unter dem Titel „Ox Alpha is GLM“. Einen Tag später legte das Sicherheitsunternehmen CTGT ein Verhaltens-Fingerprinting zur Herkunft von Ox Alpha nach. Alle 11 Tokenizer-Proben, von Emojis bis zu koreanischer Schrift, passten exakt zur GLM-Familie, und der Endpoint gab eine Fehlermeldung im Z.ai-typischen Format aus. Zur Spur passte die Vorgeschichte, denn OpenRouter hatte schon früher anonyme Modelle unter Codenamen wie „Hunter Alpha“ getestet, hinter denen sich chinesische Anbieter verbargen.
| Datum | Ereignis |
|---|---|
| 20.08.2026 | Ox Alpha erscheint anonym und kostenlos auf OpenRouter und im Coding-Agenten OpenCode |
| 21.08.2026 | Rund 2 Billionen Tokens an einem Tag, erste Google-Andeutungen auf X; Stripe-Chef Patrick Collison nennt das Modell „sehr beeindruckend“ |
| 22.08.2026 | Die Spekulation „Ox Alpha ist Gemini“ macht die Runde |
| 23.08.2026 | TechCrunch fragt „Wer steckt hinter Ox Alpha?“; Analyst Dan Petrovic veröffentlicht „Ox Alpha is GLM“ |
| 24.08.2026 | OpenRouter meldet fast 6 Billionen Tokens an einem Tag; CTGT veröffentlicht Verhaltens-Fingerprinting |
| 25.08.2026 | Platz 1 der OpenRouter-Wochenrangliste vor DeepSeek, 558 gelistete Modelle |
| 26.08.2026 | Z.ai bestätigt die Urheberschaft gegenüber Bloomberg und veröffentlicht GLM-5.3-Flash samt Gewichten |
| 27.08.2026 | Die Aktie des Mutterunternehmens Zhipu legt an der Börse Hongkong deutlich zu |
Was ist ein Stealth-Modell?
Ein Stealth-Modell ist ein KI-Modell, das ein Anbieter vor dem offiziellen Start anonym unter einem Codenamen testet. Plattformen wie OpenRouter stellen es kostenlos bereit, im Gegenzug darf der Anbieter die Eingaben der Nutzer auswerten und für das Training verwenden. Der Hersteller erhält so ehrliches Feedback unter Volllast, ohne dass sein Markenname die Urteile färbt. Frühere Codenamen wie „Hunter Alpha“ und „Healer Alpha“ entpuppten sich als Modelle des chinesischen Konzerns Xiaomi.
Die Auflösung: 320 Milliarden Parameter unter MIT-Lizenz
GLM-5.3-Flash ist das erste nativ multimodale Modell der GLM-5-Serie und verarbeitet Text, Bilder und Video in einem Kontextfenster von 1 Million Tokens. Technisch handelt es sich um ein Mixture-of-Experts-Modell mit 320 Milliarden Parametern, von denen pro Antwort nur 18 Milliarden aktiv rechnen. Z.ai kombiniert dafür laut der offiziellen Ankündigung zu GLM-5.3-Flash erstmals Sparse Attention mit Linear Attention. Verglichen mit dem großen Schwestermodell GLM-5.3 sinkt der Rechenaufwand für die Aufmerksamkeits-Schicht um den Faktor 3, der Zwischenspeicher schrumpft um den Faktor 4,4.
Introducing GLM-5.3-Flash
— Z.ai (@Zai_org) August 26, 2026
– Leading capabilities at a highly competitive price
– Natively multimodal with a 1M-token context window
– A 320B-A18B model released under the MIT License
– Previously previewed as Ox Alpha, running entirely on Chinese AI chips
Die Modellgewichte stehen als Open Weights unter der besonders freien MIT-Lizenz auf Hugging Face bereit, auch die kommerzielle Nutzung ist erlaubt. Bis Ende August zählte die Plattform bereits über 379.000 Downloads. In den selbst veröffentlichten Benchmarks rückt das kleine Modell nah an die teuersten Systeme des Marktes heran, in einzelnen Tests zieht es vorbei.
| Benchmark | GLM-5.3-Flash | DeepSeek-V4-Vision-Exp | Claude Opus 4.8 | GPT-5.6 Terra |
|---|---|---|---|---|
| Terminal Bench 2.1 (Coding-Agent) | 84,3 | 83,9 | 85,0 | 87,4 |
| DeepSWE v1.1 (Software-Aufgaben) | 63,4 | 59,3 | 58,0 | 69,6 |
| Toolathlon Verified (Werkzeug-Nutzung) | 78,4 | 75,9 | 76,2 | 74,9 |
| AutomationBench v1.0.6 | 48,8 | 38,8 | 41,0 | 37,2 |
| GDPval-AA v2 (Elo-Wertung) | 1773 | 1675 | 1582 | 1571 |
Die Zahlen stammen aus Z.ais eigener Veröffentlichung und sind nicht unabhängig bestätigt. heise online verwies während der Testwoche auf eine deutlich niedrigere DeepSWE-Messung von 58,4 Prozent für Ox Alpha, während in sozialen Netzwerken höhere Werte kursierten. Z.ai-Mitarbeiter Zixuan Li erklärte dazu auf X, Ox Alpha sei eine frühe Version gewesen, die offizielle Fassung liefere mehr Leistung und deutlich bessere Stabilität.
Frontier-Niveau für 9 Cent pro Aufgabe
Der unabhängige Bewertungsdienst Artificial Analysis misst für GLM-5.3-Flash 57 Punkte im Intelligence Index und damit Rang 4 von 111 geprüften Modellen. Das Modell sitze „bequem an der Pareto-Front“ aus Intelligenz und Kosten pro Aufgabe, so der Dienst. Die stärksten Systeme des Marktes liegen 3 bis 6 Punkte darüber: Claude Opus 5 erreicht 63 Punkte, Claude Fable 5 kommt auf 62, GPT-5.6 Sol und Grok 4.6 auf 61.
Interessant wird der Vergleich beim Preis. Für eine Aufgabe des Index berechnet Artificial Analysis bei GLM-5.3-Flash 0,09 Dollar, bei GPT-5.6 Sol dagegen 0,95 Dollar. Für 4 Indexpunkte mehr zahlen Kunden also mehr als das Zehnfache, was Z.ais Werbeaussage zur zehnfach teureren Intelligenzklasse stützt. Noch deutlicher wird es bei gleichem Punktwert. Metas Muse Spark 1.2 erreicht ebenfalls 57 Punkte, kostet pro Aufgabe aber 0,40 Dollar, also das Viereinhalbfache. Mit dem Startrabatt sinkt der Preis von GLM-5.3-Flash sogar auf 0,045 Dollar pro Aufgabe.
Kosten pro Aufgabe im Modellvergleich
Gewichtete Durchschnittskosten in US-Dollar pro Aufgabe des Intelligence Index, Vergleichsauswahl von Artificial Analysis. Der Punktwert im Index steht in Klammern hinter dem Modellnamen: niedrige Kosten sind gut, hohe Punktzahl auch.
Zahlen als Tabelle
| Modell | Indexpunkte | Kosten pro Aufgabe |
|---|---|---|
| GPT-5.6 Luna | 52 | 0,05 $ |
| GLM-5.3-Flash | 57 | 0,09 $ |
| DeepSeek V4 Pro 0813 | 53 | 0,27 $ |
| Nemotron 3 Ultra | 38 | 0,38 $ |
| Muse Spark 1.2 | 57 | 0,40 $ |
| Gemini 3.7 Flash | 56 | 0,40 $ |
| GLM-5.3 | 60 | 0,68 $ |
| Kimi K3 | 60 | 0,84 $ |
| Grok 4.6 | 61 | 0,94 $ |
| GPT-5.6 Sol | 61 | 0,95 $ |
| Claude Opus 5 | 63 | 2,34 $ |
| Claude Fable 5 | 62 | 3,14 $ |
Das billigste Modell des Feldes ist GLM-5.3-Flash allerdings nicht. GPT-5.6 Luna kostet mit 0,05 Dollar pro Aufgabe noch weniger, erreicht im Index aber nur 52 Punkte. DeepSeek V4 Pro liegt bei 0,27 Dollar und 53 Punkten, Nvidias Nemotron 3 Ultra sogar bei 0,38 Dollar für 38 Punkte. Günstiger als GLM-5.3-Flash ist in dieser Auswahl also nur, wer beim Können zurücksteckt.
Auch die reinen API-Preise unterbieten die westliche Konkurrenz deutlich. Der Listenpreis liegt bei 0,15 Dollar pro Million Eingabe-Tokens und 0,50 Dollar pro Million Ausgabe-Tokens. Bis zum 9. September 2026 gilt ein Einführungsrabatt von 50 Prozent. Über OpenRouter bieten heute 21 Anbieter das Modell an, und wer den Coding-Abo-Tarif von Z.ai nutzt, erhält GLM-5.3-Flash mit dem Dreifachen des bisherigen Kontingents. Das offene chinesische Konkurrenzmodell Kimi K3 von Moonshot AI erreicht zwar 3 Indexpunkte mehr, ist mit 2,8 Billionen Parametern aber fast neunmal so groß und kostet pro Aufgabe das gut Neunfache.
100.000 chinesische Chips, und niemand nennt den Hersteller
Nach Angaben von Z.ai lief der gesamte Ox-Alpha-Verkehr, also Billionen Tokens pro Tag, auf einem Cluster aus rund 100.000 in China produzierten KI-Chips. Die Inferenz-Software dafür hat Z.ai auf Basis des Open-Source-Frameworks SGLang selbst entwickelt und nach eigenen Angaben die Leistung des Systems auf derselben Hardware verdreifacht. Kosten pro Token und Effizienz seien damit „vergleichbar mit gängigen Nvidia-GPUs“.
Unabhängig überprüfen lässt sich das bisher nicht. Der US-Sender CNBC konnte die Chip-Angaben nach eigener Aussage nicht verifizieren, einen Hersteller nennt Z.ai nicht. Beobachter halten Beschleuniger von Huawei für die wahrscheinlichste Grundlage, belegt ist das nicht. Z.ai steht seit Januar 2025 auf der Entity List der US-Regierung und hat damit keinen legalen Zugang zu den stärksten Nvidia-Chips. Schon das große Sprachmodell GLM-5 will das Unternehmen komplett auf Huawei-Ascend-Hardware trainiert haben. Der deutsche Fachdienst The Decoder bringt den Fall in seiner Analyse zu GLM-5.3-Flash auf die Formel, das Modell laufe „ohne Nvidia“ und koste „einen Bruchteil der Konkurrenz“.
Z.ai: Vom Tsinghua-Ableger zum ersten Börsengang der KI-Tiger
Z.ai firmierte bis Juli 2025 international unter dem Namen Zhipu AI. Gegründet wurde das Unternehmen 2019 als Ausgründung der Tsinghua-Universität in Peking. Die GLM-Reihe zählt seit Jahren zu den stärksten offenen Modellfamilien, die Version GLM-4.6 etablierte sich 2025 als günstige Coding-Alternative. Als erstes der als „KI-Tiger“ bekannten chinesischen KI-Start-ups wagte das Unternehmen am 8. Januar 2026 den Börsengang in Hongkong, bei einer Bewertung von umgerechnet rund 7,1 Milliarden US-Dollar.
An der Börse Hongkong legte die Aktie laut CNBC am Tag nach der Bekanntgabe rund 8 Prozent zu, zum Handelsschluss meldete die South China Morning Post sogar über 12 Prozent Plus. Der halbierte Einführungspreis für die API gilt noch bis zum 9. September 2026.