OpenAI hat am 13. August 2026 einen neuen Hochgeschwindigkeits-Modus für seine API vorgestellt. GPT-5.6 Sol Ultrafast liefert nach Angaben des Unternehmens bis zu 750 Tokens pro Sekunde und antwortet damit bis zu 14-mal schneller als die Standard-Verarbeitung desselben Modells. Die Rechenleistung kommt nicht von Nvidia-GPUs, sondern von Spezialchips des kalifornischen Herstellers Cerebras.
GPT-5.6 Sol ist das im Juli 2026 veröffentlichte Spitzenmodell von OpenAI. Wer Echtzeit-Tempo brauchte, musste laut OpenAI bisher meist auf ein kleineres oder spezialisiertes Modell ausweichen. Genau das soll der neue Modus ändern, OpenAI spricht in der offiziellen Ultrafast-Ankündigung von einer „neuen Geschwindigkeitsklasse für Frontier-Intelligenz“.
Der Modus startet als begrenzte Preview für ausgewählte Kunden. Einen Preis und einen Termin für die allgemeine Verfügbarkeit nennt OpenAI noch nicht.
GPT-5.6 Sol Ultrafast startet als begrenzte Preview in der API
Ultrafast ist zunächst nur in der OpenAI-API verfügbar, und dort nur für eine ausgewählte Gruppe von Geschäftskunden. Wer nicht dazugehört, kann sich über ein Formular benachrichtigen lassen; OpenAI will den Zugang erweitern, sobald die Rechenkapazität wächst.
Die 14-fache Beschleunigung vergleicht OpenAI mit dem eigenen Standard-Betrieb. Das unabhängige Messportal Artificial Analysis misst GPT-5.6 Sol dort bei rund 67 Tokens pro Sekunde (Stand Mitte August 2026). Gemessen an diesem Wert wäre Ultrafast gut elfmal so schnell, die 14x-Angabe ist OpenAIs eigene Messlatte.
Einen bezahlten Tempo-Aufschlag gibt es in der API bereits. Seit Ende Juli heißt die bisherige Priority-Verarbeitung „Fast mode“, sie beschleunigt Sol laut OpenAI-Dokumentation zum Fast mode um das bis zu 2,5-Fache und kostet den doppelten Token-Preis. Ultrafast setzt eine Stufe darüber an, taucht in der offiziellen Preisliste aber noch gar nicht auf. Wie sich die API-Kosten der großen Anbieter generell unterscheiden, zeigt unser Preisvergleich von Claude und ChatGPT.
| Tarif | Tempo (GPT-5.6 Sol) | Preis je 1 Mio. Tokens (Input / Output) |
|---|---|---|
| Batch | asynchron, Ergebnisse binnen Stunden | 2,50 $ / 15 $ |
| Flex | langsamer, ohne Verfügbarkeits-Garantie | 2,50 $ / 15 $ |
| Standard | rund 67 Tokens/Sekunde* | 5 $ / 30 $ |
| Fast (bis Juli „Priority“) | bis zu 2,5x schneller | 10 $ / 60 $ |
| Ultrafast (Preview) | bis zu 750 Tokens/Sekunde (bis zu 14x) | noch nicht bekannt |
In der Ankündigung nennt OpenAI fünf Einsatzfelder, in denen das Tempo den Unterschied machen soll:
- Incident Response: Während eines laufenden Ausfalls Logs, Code-Änderungen und Berichte auswerten, um die Ursache einzugrenzen
- Finanzresearch und Sicherheit: Marktsignale und Transaktionen analysieren, solange sich die Lage noch ändert
- Kundensupport und Sprach-KI: Komplexe, mehrstufige Anliegen lösen, ohne das Gespräch zu unterbrechen
- Online-Handel: Produktfragen, Lagerbestand und Kaufabbrüche klären, während der Kunde noch überlegt
- Live-Forschung: Experimente, die bisher über Nacht liefen, werden zu interaktiven Arbeitssitzungen
Hinter den Chips steckt ein Deal über 20 Milliarden Dollar
Ultrafast ist der zweite Schritt einer Partnerschaft, die OpenAI und Cerebras im Januar 2026 geschlossen haben. Die Vereinbarung umfasst Wafer-Scale-Inferenzsysteme mit bis zu 750 Megawatt Leistung, ausgerollt in Stufen bis 2028. TechCrunch bezifferte den Cerebras-Deal bei der Ankündigung auf mehr als 10 Milliarden Dollar; im Juni legte Cerebras im Quartalsbericht nach und nannte über 20 Milliarden Dollar. OpenAI stützt den Partner außerdem mit einem Betriebsmittel-Darlehen über eine Milliarde Dollar und hält laut IPO-Prospekt Bezugsrechte auf rund 33 Millionen Cerebras-Aktien.
Den ersten Produktiveinsatz hatte die Partnerschaft im Februar. GPT-5.3 Codex Spark, ein destilliertes Coding-Modell, lieferte in der Research Preview über 1.000 Tokens pro Sekunde und war laut Bloomberg OpenAIs erstes Produktionsmodell auf Chips eines Nvidia-Konkurrenten. Der Cerebras-Vertrag ergänzt OpenAIs Compute-Deals mit Nvidia, AMD und Broadcom sowie das Rechenzentrumsprojekt Stargate.
Warum ein Chip in Wafer-Größe schneller antwortet als eine GPU
Bei der Inferenz, also dem laufenden Betrieb eines KI-Modells, müssen GPUs die Modellgewichte für jedes erzeugte Token aus dem externen Speicher heranschaffen. Diese Speicher-Bandbreite gilt als der eigentliche Flaschenhals, nicht die Rechenleistung.
Die Wafer Scale Engine von Cerebras ist ein einzelner Chip in der Größe einer ganzen Silizium-Scheibe. Die aktuelle Generation WSE-3 vereint 4 Billionen Transistoren, 900.000 Rechenkerne und 44 Gigabyte SRAM direkt auf dem Chip. Die Modellgewichte bleiben dort liegen, der Umweg über externen Speicher entfällt, und die Tokens fließen durch verkettete Chips wie durch eine Pipeline.
Jane Street, Podium, Basis und Rogo testen zuerst
Vier Unternehmen nennt OpenAI als frühe Tester, sie kommen aus Finanzhandel, Kundenkommunikation, Buchhaltung und Finanzresearch. Die Preview beschränkt sich bewusst auf Geschäftskunden, weil OpenAI dort in echten Produktionsumgebungen beobachten will, wo eine Größenordnung mehr Tempo den meisten Wert schafft.
| Unternehmen | Geschäft | Einsatz von Ultrafast |
|---|---|---|
| Jane Street | Quantitative Handelsfirma aus New York, handelt an über 200 Börsenplätzen in 45 Ländern | Entwickler arbeiten fokussierter mit dem Modell als Programmier-Partner |
| Podium | Kommunikations-Plattform für lokale Unternehmen (Chat, SMS, Telefon-KI) | Sprach-KI am Telefon, auch bei komplexen Anliegen |
| Basis | Baut KI-Agenten für Buchhaltungs- und Prüfungskanzleien, bewertet mit 1,15 Milliarden Dollar | Flüssige Nutzererlebnisse statt Wartezeiten |
| Rogo | KI-Finanzresearch für Investmentbanken und Fonds, über 35.000 Nutzer bei mehr als 250 Instituten | Finanzrecherche im Echtzeit-Dialog |
Ultrafast erlaubt uns synchrone Nutzererlebnisse, die bisher an der Intelligenz gescheitert sind. Die Hürde für wirklich schnelle Produkte sind oft nicht nur Tokens pro Sekunde, sondern auch die Intelligenz des Modells. Ultrafast kombiniert beides.Mitch Troyanovsky, Mitgründer von Basis, in der OpenAI-Ankündigung (übersetzt)
Auch intern nutzt OpenAI den Modus. Bei Störungen lesen Engineering-Teams damit Logs und Traces, fassen Chat-Verläufe zusammen und bereiten Korrekturen vor, während der Ausfall noch läuft; die Entscheidung und das Deployment bleiben beim Menschen. Forschungsteams starteten ihre Experiment-Reihen bisher über Nacht und werteten sie am Morgen aus, mit Ultrafast sollen mehrere Durchläufe an einem einzigen Arbeitstag möglich sein.
Google machte Gemini 3.7 Flash am selben Tag allgemein verfügbar
Am 13. August, dem Tag der Ultrafast-Ankündigung, machte Google sein Tempo-Modell Gemini 3.7 Flash in der API allgemein verfügbar. Der Einführungspreis liegt bei 0,75 Dollar je Million Input-Tokens und 3,75 Dollar für Output, ab Januar 2027 verdoppeln sich die Sätze. Artificial Analysis misst das Modell bei rund 340 Tokens pro Sekunde. Google liefert damit ein eigenes schnelles Modell sofort an alle aus, während OpenAI Spitzentempo vorerst nur auf Einladung und auf gemieteter Spezial-Hardware anbietet, so beschreibt das Tech-Magazin Decrypt den Strategie-Kontrast.
Laut dem Cerebras-Blogbeitrag zu Ultrafast absolvierte Sol im neuen Modus den KI-Benchmark Humanity’s Last Exam mit 2.500 Fragen in 11 Stunden und 11 Minuten, Claude Fable 5 brauchte im selben Vergleich 78 Stunden und 27 Minuten. Im Output-Tempo sieht der Chiphersteller sein System 11-mal so schnell wie Claude Fable 5 und 5-mal so schnell wie Claude Opus 4.8 im Fast mode. Unabhängige Messungen des neuen Modus stehen noch aus, alle bisherigen Zahlen stammen von OpenAI und Cerebras selbst. TechCrunch merkt dazu an, dass auch Anthropic einen Fast mode anbietet, der aber nicht die jetzt versprochenen Werte erreicht.
Output-Geschwindigkeit im Vergleich: Tokens pro Sekunde
GPT-5.6 Sol Ultrafast (Herstellerangabe von OpenAI) gegen Live-Messwerte von Artificial Analysis für aktuelle Modelle im Standard-Betrieb, gerundet (Stand 15. August 2026).
Zahlen als Tabelle
| Modell | Output-Tokens pro Sekunde |
|---|---|
| GPT-5.6 Sol Ultrafast | 750 |
| Gemini 3.7 Flash | 340 |
| Claude Fable 5 | 69 |
| GPT-5.6 Sol Standard | 67 |
| Claude Opus 5 | 62 |
Auch die übrigen Spezialisten für schnelle Inferenz haben 2026 große Partner gefunden. Nvidia lizenzierte im Dezember 2025 die Inferenz-Technik des Chip-Startups Groq für berichtete 20,6 Milliarden Dollar und übernahm dessen Führungsteam, SambaNova verbündete sich im April mit Intel.
Cerebras-Aktie fällt trotz des Prestige-Auftrags
Am 13. August schloss die Cerebras-Aktie laut US-Marktdaten knapp 12 Prozent im Minus. Belastet hatten bereits am Vorabend die Quartalszahlen, CNBC meldete nach dem Q2-Bericht einen Kurssturz von 14 Prozent.
Dabei war Cerebras erst am 14. Mai 2026 an die Nasdaq gegangen, mit einem Ausgabepreis von 185 Dollar, einem Kurssprung von 68 Prozent am ersten Handelstag und einer Bewertung von rund 66 Milliarden Dollar zum ersten Schlusskurs.
Der Analyst Patrick Moorhead von Moor Insights & Strategy warnte nach den Q1-Zahlen, die Kundenkonzentration von Cerebras sei nicht verschwunden, sondern habe nur gewechselt. Wer das Klumpenrisiko G42 gegen OpenAI tausche, schaffe eher einen größeren einzelnen Ausfallpunkt als echte Diversifikation. Der Tech-Konzern G42 aus Abu Dhabi stand 2023 noch für 83 Prozent des Cerebras-Umsatzes. Das deutsche Fachmagazin The Decoder wertet Ultrafast zugleich als neuen Preishebel, mit dem OpenAI Geschwindigkeit künftig als eigenes Produkt bepreisen kann.
Viele Kernfragen lässt die Preview offen. OpenAI nennt weder Preis noch Starttermin für die allgemeine Verfügbarkeit, keine Verfügbarkeitsgarantien und keine Regionen. Auch auf welcher Chip-Generation der Modus läuft, sagen die Partner nicht. Für den 18. August hat Cerebras sein Livestream-Event „Supernova“ angesetzt und dort die Vorstellung der nächsten Systemgeneration CS-4 in Aussicht gestellt.
Update (4. September 2026): Mit GPT-6 Astra hat OpenAI den Nachfolger von Sol gestartet, zum 2,5-fachen Aktionspreis von 10 und 50 US-Dollar je Million Token. Auch Astra bekommt einen Fast-Modus mit bis zu doppeltem Tempo zum doppelten Preis, mit EU-Datenresidenz steht er allerdings nicht zur Verfügung. Alle Preise und Limits im Release-Artikel zu GPT-6 Astra.