Glossareintrag
Wir denken. KI tippt mit.
Wafer Scale Engine (kurz WSE) heißt der KI-Prozessor der kalifornischen Firma Cerebras Systems, der weltweit größte Computerchip. Statt eine runde Silizium-Scheibe (den Wafer) wie üblich in Hunderte einzelne Chips zu zersägen, nutzt Cerebras fast die komplette Scheibe als einen einzigen Prozessor. Die aktuelle Generation WSE-3 misst 46.225 Quadratmillimeter bei rund 21,5 Zentimetern Kantenlänge und vereint 4 Billionen Transistoren, 900.000 Rechenkerne und 44 Gigabyte Arbeitsspeicher direkt auf dem Chip.
Damit ist der Cerebras-Chip die direkte Alternative zur GPU-Palette von Nvidia, die viele einzelne Chips per Netzwerk zu großen Clustern verbindet. Eine WSE-3 bietet rund die 57-fache Fläche einer Nvidia H100 und hält ein KI-Modell komplett im eigenen Speicher. Der Geschwindigkeitsvorteil zeigt sich bei der Inferenz, dem laufenden Betrieb.
Was schnelle KI-Antworten am stärksten begrenzt, ist die Speicherbandbreite. Genau hierfür ist das Wafer-Format. Beim Erzeugen jedes einzelnen Tokens müssen sämtliche Gewichte des Sprachmodells durch den Speicher der Rechenkerne wandern. GPUs lagern diese Gewichte in externen HBM-Speicherbausteinen neben dem Chip, deren Anbindung bei einer Nvidia H100 rund 3 Terabyte pro Sekunde schafft. Die WSE-3 hält die Gewichte stattdessen in 44 Gigabyte SRAM direkt neben den Kernen und erreicht 21 Petabyte pro Sekunde, nach der Vergleichsrechnung von Cerebras rund das 7.000-Fache.
Dass jahrzehntelang niemand einen Chip in Wafer-Größe baute, lag an den Produktionsfehlern. Auf jedem Wafer sitzen Defekte; beim klassischen Zersägen wandern nur die betroffenen Einzelchips in den Ausschuss, ein wafergroßer Prozessor wäre dagegen praktisch immer beschädigt. Die Großrechner-Ikone Gene Amdahl scheiterte in den 1980er Jahren mit seiner Firma Trilogy Systems und rund 230 Millionen Dollar Kapital an genau diesem Problem. Cerebras umgeht es mit hunderttausenden bewusst winzig gehaltenen Kernen und eingebauten Reserven. Fällt ein Kern aus, leitet das Verbindungsnetz auf dem Chip die Daten um ihn herum; laut dem Firmenblog zur Defekttoleranz bleiben so 93 Prozent der Siliziumfläche nutzbar.
Die erste WSE erschien 2019 mit 400.000 Kernen, 2021 folgte die WSE-2 mit 850.000, seit März 2024 ist die WSE-3 aktuell. Verbaut wird der Chip im wassergekühlten Rechenzentrums-System CS-3, das rund 23 Kilowatt Leistung aufnimmt. Im August 2026 stellte Cerebras zusätzlich das Rack-System CS-4 mit drei höher getakteten „WSE-3 Turbo“-Wafern vor, nach Firmenangaben bis zu 30-mal schneller als GPU-Systeme; die ersten Auslieferungen sollen noch im selben Quartal beginnen. Große Sprachmodelle passen allerdings nicht in 44 Gigabyte; sie laufen deshalb in Etappen über mehrere verkettete Wafer wie durch eine Pipeline.
Das unabhängige Vergleichsportal Artificial Analysis maß im Mai 2026 für das Billionen-Parameter-Modell Kimi K2.6 auf Cerebras-Systemen 981 Tokens pro Sekunde, laut einem Bericht über die Kimi-Messung 6,7-mal so viel wie beim schnellsten GPU-Anbieter. Auf der Technik laufen mittlerweile Dienste von Mistral, Meta und Hugging Face. Den größten Auftrag brachte die im Januar 2026 geschlossene Partnerschaft mit OpenAI über Wafer-Scale-Systeme mit bis zu 750 Megawatt Leistung bis 2028, laut Medienberichten mehr als 10 Milliarden Dollar schwer. Seit dem 13. August 2026 läuft darauf als Vorschau für API-Kunden der Ultrafast-Modus von GPT-5.6 Sol, nach OpenAI-Angaben mit bis zu 750 Tokens pro Sekunde und bis zu 14-facher Geschwindigkeit.
Im Mai 2026 ging Cerebras unter dem Kürzel CBRS an die Nasdaq und nahm beim Börsengang rund 5,5 Milliarden Dollar ein. Kein anderer Anbieter verkauft derzeit wafergroße KI‑Prozessoren. Googles TPUs und die Technik des Anbieters Groq, die sich Nvidia Ende 2025 per Lizenzabkommen sicherte, setzen auf klassisch dimensionierte Spezialchips. Tesla stellte sein eigenes Wafer-Projekt Dojo im Sommer 2025 ein und kündigte Anfang 2026 einen Neustart als Dojo 3 an.
Kaufen wird ein Betrieb eine Wafer-Scale-Engine nie; die Systeme stehen in Rechenzentren von Cerebras und seinen Partnern. Spürbar wird die Technik, wenn ein KI-Werkzeug seine Antworten aus einer Cerebras-Cloud bezieht und praktisch ohne Wartezeit reagiert.
Erstklassig für das Tempo am Telefon und bei KI-Agenten. Kundenanrufe, die eine Voice-KI für ein Unternehmen annimmt, wirken am natürlichsten, wenn die Antwort ohne Stille oder Denkpause kommt. Ein Agent wiederum, der ein Angebot mit zwanzig Positionen kalkuliert, ruft das Sprachmodell viele Male nacheinander auf; jede eingesparte Sekunde multipliziert sich über die gesamte Kette. Auf solche Einsätze zielt OpenAI mit dem Ultrafast-Modus für Geschäftskunden.
Selbst ausprobieren lässt sich das Tempo im Chat von Cerebras Inference, wo offene Modelle wie GPT-OSS oder Gemma mit weit über 1.000 Tokens pro Sekunde antworten. Wer eigene Anwendungen baut oder bauen lässt, erhält dieselben Modelle per API aus der Cerebras-Cloud mit einem kleinen Startguthaben. Die aktuellen Konditionen stehen auf der offiziellen Preisseite von Cerebras. Wer in Mistrals Le Chat schon einmal die „Flash Answers“ ausprobiert hat, hat diese Technik längst benutzt. Dahinter steckt genau dasselbe Wafer-Prinzip.