Grok 4.6:
SpaceXAI greift die KI-Spitze zum Kampfpreis an

Veröffentlicht: 19/08/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Schulte_Markus_300x300px

Markus Schulte

AI Solution Development, Autor

Inhaltsverzeichnis
Teilen
AI Newsletter

SpaceXAI, die KI-Sparte des Raumfahrtkonzerns SpaceX, hat am 12. August 2026 das KI-Modell Grok 4.6 veröffentlicht und kehrt damit in die Spitzengruppe der KI-Modelle zurück. Im Intelligence Index des unabhängigen Analysehauses Artificial Analysis erreicht das Modell 61 Punkte, gleichauf mit OpenAIs Flaggschiff GPT-5.6 Sol. Davor stehen nur noch Claude Opus 5 (63 Punkte) und Claude Fable 5 (62 Punkte) von Anthropic.

Der Preis bleibt trotz des Leistungssprungs auf dem Niveau des Vorgängers. SpaceXAI verlangt 2 Dollar pro Million Input-Tokens und 6 Dollar pro Million Output-Tokens, weniger als die Hälfte der Sätze von Claude Opus 5 und GPT-5.6 Sol. Grok 4.6 erscheint keine vier Wochen nach Grok 4.5 vom 16. Juli und ist laut der offiziellen Grok-4.6-Ankündigung auf langlaufende KI-Agenten sowie auf interaktive und visuelle Projekte ausgelegt.

In der Grok-App und auf X ist das neue Modell zum Start nicht enthalten. Stattdessen positioniert SpaceXAI Grok 4.6 zunächst als Werkzeug für Entwickler und Wissensarbeiter, unter anderem im Code-Editor Cursor und im hauseigenen Coding-Agenten Grok Build.

Gleichauf mit GPT-5.6 Sol: die Messung von Artificial Analysis

Artificial Analysis hat die 61 Punkte unabhängig nachgemessen und führt Grok 4.6 auf Rang 6 von 188 gelisteten Modellkonfigurationen. Gegenüber Grok 4.5 legt das Modell um 5 Punkte zu, gegenüber dem älteren Grok 4.3 um 23 Punkte. Die Analyse von Artificial Analysis zu Grok 4.6 ordnet das Modell im hauseigenen Wissensarbeits-Test GDPval-AA v2 direkt hinter Claude Opus 5 ein und beziffert den Preisabstand zur direkten Konkurrenz auf mehr als 60 Prozent.

Im Projekt-Benchmark AA-Briefcase erledigt Grok 4.6 seine Aufgaben in durchschnittlich 53 Arbeitsschritten mit rund 0,5 Milliarden Input-Tokens; Claude Opus 5 braucht für vergleichbare Ergebnisse laut Artificial Analysis etwa 103 Schritte und 2 Milliarden Tokens. Eine Aufgabe des Intelligence Index kostet mit Grok 4.6 im Schnitt 0,84 Dollar.

Schwächen zeigen die Messdaten beim Tempo. Mit 69,3 Tokens pro Sekunde liegt Grok 4.6 nur auf Rang 87 von 188 in der Geschwindigkeits-Rangliste, und bis zum ersten Token vergehen bei dem Reasoning-Modell im Schnitt über 36 Sekunden. Der Vorgänger Grok 4.5 lieferte laut damaliger Ankündigung noch rund 80 Tokens pro Sekunde und zählte damit zu den schnellsten Modellen seiner Klasse.

KI-Modelle im Intelligence Index von Artificial Analysis (August 2026)

Composite-Wert aus neun Benchmarks, je Modell die stärkste von Artificial Analysis gemessene Konfiguration. Grok 4.6 zieht mit GPT-5.6 Sol gleich; Claude Opus 5 fehlt in der Vergleichstabelle von SpaceXAI.

Quelle: Artificial Analysis, Stand 15.08.2026.
Zahlen als Tabelle
ModellIntelligence Index
Claude Opus 563 Punkte
Claude Fable 562 Punkte
Grok 4.661 Punkte
GPT-5.6 Sol61 Punkte
Grok 4.556 Punkte
Screenshot des Grok 4.6 Intelligence Index mit Wert 61 (Rang 6/188), API-Kosten und Ausgabegeschwindigkeit von 69,3 Token/Sekunde
Die Modellseite von Grok 4.6 bei Artificial Analysis: 61 Punkte, Rang 6 von 188 (Quelle: Artificial Analysis, 15.08.2026)

Preise: mindestens 60 Prozent unter Claude Opus 5 und GPT-5.6 Sol

Die 2 und 6 Dollar pro Million Tokens gelten für Anfragen bis 200.000 Prompt-Tokens, und damit unterbietet Grok 4.6 die Listenpreise aller Modelle, die im Intelligence Index vor ihm liegen, um mehr als die Hälfte. OpenAI berechnet für GPT-5.6 Sol das Zweieinhalbfache beim Input und das Fünffache beim Output, Anthropic für Claude Fable 5 sogar das Fünffache und mehr als das Achtfache.

ModellAnbieterInput je 1 Mio. TokensOutput je 1 Mio. Tokens
Grok 4.6SpaceXAI2,00 $6,00 $
Grok 4.5SpaceXAI2,00 $6,00 $
GPT-5.6 TerraOpenAI2,00 $12,00 $
GPT-5.6 SolOpenAI5,00 $30,00 $
Claude Opus 5Anthropic5,00 $25,00 $
Claude Fable 5Anthropic10,00 $50,00 $

Hinweis: Listenpreise laut der API-Preisliste von SpaceXAI, der OpenAI-Preisübersicht und der Anthropic-Preisdokumentation, Stand 15.08.2026.

Ab 200.000 Prompt-Tokens pro Anfrage verdoppeln sich die Grok-Sätze auf 4, 1 und 12 Dollar für Input, Cache-Treffer und Output. Den Preis für Cache-Treffer hat SpaceXAI gegenüber Grok 4.5 außerdem von 0,30 auf 0,50 Dollar pro Million Tokens angehoben; auf diese stille Erhöhung weist Artificial Analysis in seiner Analyse hin. Eine schnellere Variante des Modells kostet laut Ankündigung das Doppelte.

Screenshot der offiziellen SpaceXAI-Preistabelle für grok-4.6 mit 500k-Kontextfenster: Short Context kostet 2,00 (Input), 0,50 (Cache) und 6,00 Dollar (Output) je Million Tokens, Long Context ab 200.000 Tokens das Doppelte.
Die offizielle Preisstaffel für grok-4.6: ab 200.000 Prompt-Tokens verdoppeln sich die Sätze (Quelle: docs.x.ai, 15.08.2026)

Grok 4.6 Benchmarks im Gegencheck der Leaderboards

Die wichtigsten Einzelwerte aus der SpaceXAI-Ankündigung halten der unabhängigen Nachprüfung stand, das Gesamtbild verschiebt sich trotzdem. Auf den frei einsehbaren Live-Boards führt in allen Disziplinen dieselbe Modellfamilie, und die kommt in der Vergleichstabelle des Herstellers nicht vor.

Benchmark (Betreiber)AufgabenfeldGrok 4.6Führendes Modell
GDPval-AA v2 (Artificial Analysis)agentische Wissensarbeit aus 44 BerufenElo 1746Claude Opus 5 Max (1849)
AA-Briefcase (Artificial Analysis)langlaufende agentische WissensarbeitElo 1577Claude-Opus-5-Familie
APEX-Agents (Mercor)Banking-, Beratungs- und Rechtsaufgaben57,5 %, Rang 4Claude Opus 5 Max (60,6 %)
APEX-SWE (Mercor/Cognition)wirtschaftsnahe Software-Aufgaben56,4 %, Rang 3Claude Opus 5 Max (63,7 %)
DeepSWE v1.1 (Datacurve)113 langwierige Programmier-Aufgaben67 %, Rang 7Claude Opus 5 (74 %)
Terminal-Bench 3.0 (Stanford/Laude Institute)Arbeit in Terminal-Umgebungen26,5 %, Rang 4Claude Opus 5 Max (42,7 %)
LMArena WebDev (Arena)Web-Apps im menschlichen Blind-VergleichElo 1631, Rang 5Claude Opus 5 Max (1692)

Hinweis: Werte der unabhängigen Live-Leaderboards vom 15.08.2026. Einzelne Zahlen weichen leicht von den SpaceXAI-Angaben ab (etwa Elo 1746 statt 1753 bei GDPval-AA), weil die Boards fortlaufend neu messen und Elo-Wertungen sich mit jedem Paarvergleich verschieben.

In der Vergleichstabelle der Ankündigung fehlt Claude Opus 5 vollständig. SpaceXAI vergleicht sein Modell dort mit GPT-5.6 Sol Max und Claude Fable 5 Max; das Modell, dessen Konfigurationen alle sieben oben genannten Boards anführen, taucht nicht auf. Die Fußnote der Tabelle verweist lediglich darauf, dass die Konkurrenzwerte aus den veröffentlichten System Cards oder Benchmark-Leaderboards der jeweiligen Hersteller stammen.

GDPval-AA Leaderboard von Artificial Analysis: Claude Opus 5 führt mit Elo 1849 vor Grok 4.6 (1746) und Claude Fable 5 (1739), verankert an einer menschlichen Baseline von 1.000 Punkten.
GDPval-AA-Leaderboard: Claude Opus 5 führt, Grok 4.6 folgt mit Elo 1746 (Quelle: Artificial Analysis, 15.08.2026)

Bei Terminal-Bench hängt die Aussage an der Versionsnummer. In der aktuellen Version 3.0 erreicht Grok 4.6 gut 26 Prozent (GPT-5.6 Sol Max: 34,6 Prozent), in der älteren Version 2.1, die weiter in den Intelligence Index einfließt, sind es 88,4 Prozent. Beide Zahlen beschreiben dasselbe Modell.

In den menschlichen Blind-Bewertungen der LMArena-Text-Rangliste liegt grok-4.6-high mit einem Elo von 1464 auf Rang 44, hinter dem eigenen Vorgänger Grok 4.5 (1469). Die Wertung beruht allerdings erst auf rund 3.400 Stimmen und ist als vorläufig gekennzeichnet; im WebDev-Ranking, das fertige Web-Apps vergleicht, steht das Modell mit Rang 5 deutlich besser da.

Der CursorBench-Wert von 69,9 Prozent stammt aus einem Benchmark des Editor-Herstellers Cursor selbst. Cursor gehört laut einem Bericht von 9to5Mac seit Juni 2026 zu SpaceXAI, und Grok 4.6 wurde laut Model Card zu Grok 4.6 mit anonymisierten Cursor-Arbeitsdaten nachtrainiert. Den Bestwert im Rechts-Benchmark Harvey LAB gibt SpaceXAI selbst an, mit 15,8 Prozent in der Ankündigung und 22 Prozent in der Model Card; am Live-Board des Betreibers Vals AI ließ sich bis zum 15. August keiner der beiden Werte nachvollziehen. In beiden Lesarten liegt Grok 4.6 dort vor Claude Fable 5 Max (11,3 Prozent) und GPT-5.6 Sol Max (2,5 Prozent).

Im Gesamtindex schiebt sich Grok 4.6 mit 61 zu 60 Punkten knapp vor Kimi K3, das stärkste Modell mit offenen Gewichten aus China. Seit dem 26. August steht mit GLM-5.3-Flash von Z.ai ein weiteres offenes Modell aus China daneben, das mit 57 Punkten zwar darunter liegt, pro Aufgabe aber 0,09 statt 0,94 Dollar kostet.

Trainiert von Grok 4.5, verfeinert mit Cursor-Daten

Grok 4.6 gehört laut Model Card zur selben Modellfamilie mit rund 1,5 Billionen Parametern wie Grok 4.5. Statt eines kompletten Neu-Trainings setzte SpaceXAI auf einen verlängerten Zusatz-Trainingslauf mit kuratierten, teils modellgenerierten Daten zu Reasoning- und Technik-Themen sowie auf ein verbessertes Trainingsrezept.

Für die Feinabstimmung (Supervised Fine-Tuning) ließ das Team die Trainingsbeispiele vom Vorgänger Grok 4.5 komplett neu erzeugen, über verschiedene Reasoning-Stufen, Agenten-Umgebungen und Fachgebiete wie Naturwissenschaften, Software-Entwicklung und Wissensarbeit hinweg; modellbasierte Prüfungen sortierten fehlerhafte Beispiele aus. Anschließend folgte Verstärkungslernen in agentischen Umgebungen, unter anderem für Kernel-Optimierung, Web-Entwicklung und CAD-Konstruktion.

Die Model Card beschreibt dazu einen internen Testlauf, in dem ein früher Grok-4.6-Checkpoint fünf Stunden lang die eigene Inferenz-Software optimierte. Das Modell prüfte 297 Optimierungs-Kandidaten und stellte 7 Pull Requests; 3 davon laufen inzwischen in der Produktion und steigerten den Durchsatz beim Erzeugen von Antworten um 1,5 sowie beim Einlesen von Anfragen um 3,1 Prozent.

Die Model Card dokumentiert auch die Sicherheitslage. Standard-Jailbreaks kamen in den Tests nur noch in 0,04 Prozent der Fälle durch (Grok 4.5: 0,73 Prozent), die Bio- und Chemie-Fähigkeiten blieben laut SpaceXAI unter den Schwellwerten des eigenen Sicherheitsrahmenwerks. Verschlechtert haben sich die Werte bei Selbstverletzungs-Anfragen (3,7 nach zuvor 0,5 Prozent unerwünschte Antworten) und beim Ehrlichkeits-Test MASK-Rectified (3,8 nach 0,67 Prozent).

Aus xAI wird SpaceXAI

Elon Musk gründete xAI 2023 als eigenständiges KI-Unternehmen. Im März 2025 übernahm xAI die Social-Media-Plattform X, im Februar 2026 kaufte der Raumfahrtkonzern SpaceX dann das kombinierte Unternehmen; die Mitteilung „xAI joins SpaceX“ vom 2. Februar 2026 dokumentiert den Schritt. Seitdem tritt die KI-Sparte unter dem Namen SpaceXAI auf; rechtlich ist das ein Geschäftsname der XAI LLC unter dem Dach des börsennotierten SpaceX-Konzerns (Börsenkürzel SPCX).

Start in Cursor und Grok Build, die Grok-App wartet

Nutzbar ist Grok 4.6 zum Start im Code-Editor Cursor in allen Tarifen, im terminalbasierten Coding-Agenten Grok Build und über die API, dort unter der Modell-ID grok-4.6. Partner-Plattformen wie OpenRouter, Vercel und Cloudflare bieten das Modell ebenfalls an, in SpaceXAIs Office-Add-ins für Word, Excel und PowerPoint ist es bereits das Standardmodell. Seit dem 14. August steht Grok 4.6 laut dem GitHub-Copilot-Changelog auch dort zur Verfügung.

Das Kontextfenster fasst 500.000 Tokens, für die Ausgabelänge nennt die Dokumentation ausdrücklich kein Limit. Das Modell verarbeitet Text und Bilder, beherrscht Function Calling sowie Web- und X-Suche und lässt sich in vier Reasoning-Stufen von „low“ bis „xhigh“ betreiben.

Privatnutzer müssen warten. Die Consumer-Angebote, also grok.com, die Mobile-Apps und Grok auf der Plattform X, sollen das Modell laut Model Card „zu einem späteren Zeitpunkt“ erhalten. Für die erste Woche verdoppelt SpaceXAI das enthaltene Nutzungskontingent in Grok Build und Cursor.

SpaceX-Aktie springt, Grok 4.7 ist bereits angekündigt

Die SpaceX-Aktie legte am Veröffentlichungstag zeitweise rund 10 Prozent zu und erreichte laut Marktberichten in der Spitze 142,64 Dollar. Elon Musk nannte Grok 4.6 in einem Beitrag auf X „objektiv die Nummer 1, wenn man Intelligenz, Geschwindigkeit und Kosten betrachtet“.

Auf einer Betriebsversammlung bezifferte Musk den Umsatz der KI-Sparte im zweiten Quartal laut einem Bericht von The Next Web auf 2,56 Milliarden Dollar, gegenüber 5,25 Milliarden im übrigen Geschäft, und kündigte an, die KI-Erlöse würden das Raketengeschäft bis September übertreffen. Künftige Grok-Versionen sollen nach seinen Worten auf dem gesamten internen Wissen von SpaceX trainiert werden; die Belegschaft werde „faktisch die Eltern der KI“ sein, zitiert Fortune aus der Mitarbeiterversammlung.

Nur rund 4 Prozent der Unternehmen, die für KI-Werkzeuge bezahlen, entscheiden sich laut dem von Gizmodo zitierten Ramp AI Index bislang für ein Grok-Modell.

Der Nachfolger ist bereits angekündigt. Grok 4.7, laut Musk ein Modell mit 2,1 Billionen Parametern, soll wenige Wochen nach Grok 4.6 erscheinen und nach seinen Worten „in jeder Hinsicht besser“ sein, nur etwas langsamer im Betrieb. So beschrieb es der Konzernchef in einem Roadmap-Beitrag auf X Ende Juli.

Update (6. September 2026): Am 3. September 2026 fiel Grok dreieinhalb Stunden aus. SpaceXAI nannte einen Ausfall im Rechenzentrum Memphis als Grund und entschuldigte sich ausdrücklich auch bei den betroffenen Rechenpartnern, denn Anthropic mietet dort seit Mai die gesamte Kapazität von Colossus 1. Was an diesem Tag noch passierte, steht im Bericht zum Grok-Ausfall im September 2026.

ChatGPT für Handwerker &
Unternehmen

Holen Sie sich jetzt kostenlos die besten ChatGPT Prompts für lokale Dienstleister wie z.B. Handwerker. Sie werden damit bei Preisverhandlungen siegen können und Gegenargumente entkräften. Viele Prompts und ein breites Spektrum an Themen, um Ihren Arbeitsalltag zu erleichtern. Laden Sie sich jetzt diese einmalige Prompt-Bibliothek speziell für regional tätige Unternehmen & Handwerksbetriebe herunter.

Webinar Release KI im Handwerk

Sie haben eine Frage?