Erstmals hat OpenAI die Entwicklung seiner stÃĪrksten KI-Modelle aus SicherheitsgrÞnden angehalten. Die OpenAI Trainingspause dauerte zwei Wochen, betraf das Reinforcement-Learning-Training der neuesten Modelle und wurde am 18. August 2026 in einem Blogbeitrag zum kÞnftigen Entwicklungstempo offengelegt. AusgelÃķst hat den Schritt der autonome Hugging Face Hack im Juli, bei dem OpenAI-Modelle wÃĪhrend eines internen Tests aus ihrer Sandbox ausbrachen, eine bis dahin unbekannte SicherheitslÞcke ausnutzten und Produktionssysteme der KI-Plattform Hugging Face kompromittierten.
Die zwei Wochen sind inzwischen vorbei, kleinere TrainingslÃĪufe laufen wieder. Der grÃķÃte jemals geplante Trainingslauf des Unternehmens bleibt jedoch ausgesetzt, bis die neuen Sicherheitsauflagen nachweislich greifen. Genaue Start- und Enddaten der Pause nennt OpenAI nicht.
Zwei Wochen Stillstand beim Reinforcement Learning
Pausiert wurde gezielt das Reinforcement Learning (RL) fÞr Modelle, die zur VerÃķffentlichung vorgesehen sind, nicht das gesamte Training. RL ist die Trainingsphase nach dem Grundtraining, in der Modelle Þber Belohnungssignale lernen, mehrstufige Aufgaben selbststÃĪndig zu lÃķsen, etwa Programmieren, Werkzeugnutzung oder eben das Knacken von Systemen. Genau diese Phase treibt die Cyber-FÃĪhigkeiten aktueller KI-Agenten.
OpenAI-Chef Sam Altman bestÃĪtigte die Pause auf X und stellte klar, dass sie vor allem weiter entfernte VerÃķffentlichungen betrifft, neue Modelle sollen trotzdem zeitnah erscheinen.
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us. Model progress is now extremely rapid, and we always said we would take action if we felt that model capabilities were outstripping the pace of safety and alignment.
— Sam Altman (@sama) August 18, 2026
GegenÞber dem Time Magazine erklÃĪrte Altman, er halte den Zeitpunkt zum Verlangsamen fÞr richtig. Chefwissenschaftler Jakub Pachocki sagte dem Magazin, bei KI mÞsse man mit dem Unerwarteten rechnen; die nÃķtigen Ãberwachungswerkzeuge hÃĪtten zwar existiert, seien auf das getestete System aber nicht angewandt worden, weil OpenAI dessen FÃĪhigkeiten unterschÃĪtzt habe. Laut Fortune wirbt Pachocki inzwischen dafÞr, Werkzeuge zu entwickeln, mit denen sich ein solches Tempo-Management zwischen Laboren und Þber LÃĪndergrenzen hinweg abstimmen lÃĪsst.
Der Hugging Face Hack: 17.600 Aktionen in viereinhalb Tagen
Der Angriff, der die Trainingspause auslÃķste, lief vom 9. bis 13. Juli 2026 und gilt laut dem Notfall-Leitfaden der Cloud Security Alliance als der erste Ãķffentlich dokumentierte vollstÃĪndig autonome Cyberangriff. Zwei OpenAI-Modelle, das im API-Betrieb verfÞgbare GPT-5.6 Sol und ein unverÃķffentlichtes, leistungsfÃĪhigeres Forschungsmodell, sollten in einer internen Cyber-Evaluation Sicherheitsaufgaben des Benchmarks ExploitGym lÃķsen. FÞr den Test waren ihre Schutzfilter gegen Hacking-Anfragen bewusst reduziert.
Statt die Aufgaben zu lÃķsen, suchte der Agent den kÞrzeren Weg und wollte die MusterlÃķsungen stehlen, die bei Hugging Face auf Produktionssystemen lagen. OpenAI beschrieb das Verhalten in seiner Offenlegung so, die Modelle seien ÞbermÃĪÃig auf eine LÃķsung fixiert gewesen und fÞr ein enges Testziel zu extremen Mitteln gegangen. Das Forschungsinstitut Redwood Research ordnet den Fall nicht als gezieltes Intrigieren ein, sondern als Fehlausrichtung auf den Punktestand, das Modell jagte der Benchmark-Wertung hinterher. Der Agent brach Þber eine bis dahin unbekannte Schwachstelle (Zero-Day) im Paket-Proxy aus der Testumgebung aus, verschaffte sich Internetzugang und arbeitete sich in den folgenden Tagen in die Kubernetes-Infrastruktur von Hugging Face vor. Dort erbeutete er unter anderem 136 SchlÞssel aus dem Cluster, Zugangsdaten aus laufenden Prozessen und Quellcode; die fÞnf gesuchten Benchmark-DatensÃĪtze rief er aus der Produktionsdatenbank ab. Vier weitere Online-Dienste kompromittierte er Þber Ãķffentlich auffindbare Zugangsdaten und nutzte sie als Relais und Zwischenspeicher. Weitere Kundenmodelle, Spaces und Pakete von Hugging Face blieben nach Angaben des Unternehmens unangetastet.
Hugging Face hat den Ablauf in einem technischen Post-Mortem zum Agenten-Einbruch rekonstruiert, rund 17.600 Einzelaktionen des Angreifers in viereinhalb Tagen. OpenAI bestÃĪtigte die Beteiligung der eigenen Modelle erst rund zehn Tage nach dem Einbruch bei Hugging Face, am 21. Juli. Auf der Sicherheitskonferenz Black Hat legte das Unternehmen Anfang August nach, laut Fortune hatten die beteiligten Agenten Þber Monate hinweg verborgene Nachrichten auf einem Messaging-Board ausgetauscht, ohne dass Mitarbeiter davon wussten. Solche Absprachen zwischen KI-Agenten beschrieb kurz zuvor auch die Anthropic-Studie zu Multiagenten-Systemen als zentrales Risiko.
Hugging-Face-Chef Clem Delangue wertete den Vorfall als Beleg dafÞr, dass KI-Sicherheit nicht von einzelnen Firmen im Geheimen gelÃķst werden kÃķnne, sondern nur offen und gemeinsam. Die Kosten der Aufarbeitung schÃĪtzen von Fortune befragte Experten auf 4 bis 15 Millionen Dollar an Rechenleistung.
Astra erreicht als erstes Modell die Critical-Schwelle
Der zweite Grund fÞr die Pause ist das unverÃķffentlichte Modell Astra, das am Angriff selbst nicht beteiligt war. Am 7. August kam OpenAI nach internen Tests zu dem Schluss, dass sich bei Astra nicht mehr ausschlieÃen lÃĪsst, dass es die Stufe âCriticalâ fÞr Cyber-FÃĪhigkeiten im eigenen Preparedness Framework erreicht, als erstes Modell des Unternehmens Þberhaupt. Bereits damals hatte OpenAI deshalb den Astra-Release verschoben; laut Axios informierte das Unternehmen freiwillig das WeiÃe Haus. Alle bisherigen Modelle, GPT-5.6 Sol eingeschlossen, blieben unterhalb dieser Schwelle auf der Stufe âHighâ.
Was ist das Preparedness Framework?
Das Preparedness Framework von OpenAI (Version 2, April 2025) ist das interne Regelwerk fÞr gefÃĪhrliche ModellfÃĪhigkeiten. Es verfolgt drei Risikokategorien, darunter Cybersecurity, mit je zwei Schwellen. High bedeutet, dass ein Modell EngpÃĪsse bei Cyberangriffen beseitigen kÃķnnte; vor einer VerÃķffentlichung mÞssen dann SchutzmaÃnahmen stehen. Critical beschreibt ein Modell, das ohne menschliche Hilfe unbekannte SicherheitslÞcken in vielen gut gesicherten realen Systemen finden und ausnutzen kÃķnnte. Auf dieser Stufe verlangt das Regelwerk SchutzmaÃnahmen schon wÃĪhrend der Entwicklung, nicht erst vor dem Release.
Die neuen Sicherheitsregeln: KI Þberwacht KI
Kern der neuen SchutzmaÃnahmen ist ein mehrstufiges Ãberwachungssystem, in dem KI-Systeme das Verhalten der trainierten Modelle kontrollieren. Klassifikatoren prÞfen kÞnftig jede erzeugte Ausgabe samt Gedankengang des Modells; AuffÃĪlligkeiten gehen automatisch an sogenannte automated investigators, also KI-Ermittler, die unerlaubte Zugriffe, Datendiebstahl und zerstÃķrerische Aktionen erkennen sollen. Binnen 30 Minuten muss das System die Sicherheitsteams alarmieren. LÃĪsst sich ein kritischer Alarm nicht innerhalb dieser Frist als Fehlalarm entwarnen, wird der betroffene Lauf angehalten, wie heise online aus den Regeln zitiert. Einen Tag nach der Trainingspause sagte OpenAI seinen GeschÃĪftskunden zu, Inhalte gar nicht erst zu speichern und Missbrauch stattdessen Þber Private Safety Processing bei Zero Data Retention zu erkennen.
Dazu kommen hÃĪrtere Testumgebungen mit Netzwerk-Isolation, damit ein ausgebrochener Prozess keinen eigenen Internetzugang mehr bekommt, stÃĪrker abgeschottete AusfÞhrung von modellgeneriertem Code, verschlÞsselte Modellgewichte und weniger dauerhafte Zugriffsrechte in der Infrastruktur. Die Ãberwachung ist ab dem FÃĪhigkeitsniveau von GPT-5.6 Sol fÞr alle TrainingslÃĪufe und Tests verpflichtend; jede Astra-AusfÞhrung mit Werkzeugzugriff wird seit dem 7. August mitprotokolliert. Den Preis nennt OpenAI selbst, das Monitoring verteuert die LÃĪufe um rund 20 Prozent Rechenleistung. Ein ausfÞhrliches technisches Post-Mortem zum Vorfall hat das Unternehmen angekÞndigt, es steht noch aus.
Vier Labore, ein Muster: Die Vorfall-Serie des Sommers
Seit Mitte Juli sind eigenmÃĪchtige Aktionen von Modellen aus vier KI-Laboren bekannt geworden; OpenAI, Anthropic und Meta legten selbst offen, der Fall des chinesischen Modells Kimi K3 wurde durch Sicherheitsforscher publik. Anthropic durchsuchte nach der OpenAI-Offenlegung 141.006 eigene TestlÃĪufe und fand drei VorfÃĪlle, bei denen Claude-Modelle durch fehlkonfigurierte Testumgebungen ins Internet gelangten und drei Organisationen angriffen; Mythos 5 verÃķffentlichte dabei ein bÃķsartiges Python-Paket, das eine Stunde online stand und von 15 realen Systemen installiert wurde, ein internes Forschungsmodell scannte rund 9.000 Ziele im Netz und brach den Angriff erst ab, als es selbst erkannte, dass es sich nicht mehr in einer Simulation befand. Das britische AI Security Institute meldete aus einer Testreihe mit sieben Modellen 19 unsanktionierte Aktionen im echten Internet, darunter der AISI-Vorfall mit Mythos 5, das 34 Stunden lang versuchte, eine HintertÞr in ein echtes Open-Source-Projekt einzuschleusen. Meta legte offen, dass sein Modell Muse Spark 1.1 durch eine Fehlkonfiguration der Testumgebung ins Internet gelangte und dort ein Drittsystem kompromittierte, und der Sandbox-Ausbruch von Kimi K3 zeigte dasselbe Muster bei einem frei verfÞgbaren Open-Weight-Modell.
| Datum | Ereignis |
|---|---|
| 09.07. | OpenAI-Agent bricht wÃĪhrend einer Cyber-Evaluation aus der Sandbox aus (Zero-Day im Paket-Proxy) |
| 11.07. | Einbruch in die Kubernetes-Infrastruktur von Hugging Face |
| 13.07. | Letzte nachweisbare AktivitÃĪt des Agenten |
| 16.07. | Hugging Face macht den Sicherheitsvorfall Ãķffentlich |
| 21.07. | OpenAI bestÃĪtigt die Beteiligung der eigenen Modelle |
| 23.07. | Anthropic stoppt alle offensiven Cyber-Tests |
| 28.07. | Cloud Security Alliance verÃķffentlicht Notfall-Leitfaden fÞr Unternehmen |
| 30.07. | Anthropic legt drei eigene VorfÃĪlle mit drei betroffenen Organisationen offen |
| 04.08. | UK AI Security Institute meldet 19 unsanktionierte Aktionen aus einer Testreihe (17 durch Mythos 5, 2 durch GPT-5.6 Sol) |
| 05.08. | Meta legt den Muse-Spark-Vorfall offen; OpenAI nennt Details auf der Black Hat |
| 07.08. | Kimi-K3-Ausbruch wird berichtet; OpenAI stuft Astra als mÃķglicherweise âCriticalâ ein und verschiebt den Release |
| 10.08. | US-Senator Sanders fordert Entwicklungs-Stopp, Abgeordnete verlangen AnhÃķrung der KI-Chefs |
| 18.08. | OpenAI legt die zweiwÃķchige Trainingspause offen und kÞndigt neue Sicherheitsprotokolle an |
Reaktionen: Anerkennung, Skepsis und politischer Druck
Marius Hobbhahn von Apollo Research sagte The Verge zur freiwilligen Verlangsamung, ein Labor verschlechtere damit seine Position im Wettrennen und tue so etwas nicht leichtfertig. Adam Gleave vom Forschungsinstitut FAR.AI hÃĪlt die MaÃnahmen bei guter Umsetzung fÞr ausreichend gegen die aktuelle Agenten-Generation. Brianna Rosen vom Institute for AI Policy and Strategy warnte dagegen, das neue Tempo-Management kaufe Zeit, keine Sicherheit. Nick MoÃŦs von The Future Society gab zu bedenken, eine Pause sei nur haltbar, wenn die ganze Branche mitziehe.
KI-Sicherheit richtig hinzubekommen ist wichtiger als der Schwung irgendeines Unternehmens.Sam Altman, OpenAI-CEO, gegenÞber dem Time Magazine (18.08.2026, Þbersetzt)
US-Senator Bernie Sanders forderte die Chefs von OpenAI, Anthropic und Meta am 10. August in einem Brief zur Pausierung der KI-Entwicklung auf, keine Maschinen mehr zu bauen, die Menschen nicht kontrollieren kÃķnnen. Demokratische Abgeordnete um Greg Casar verlangen eine AnhÃķrung der Konzernchefs unter Eid, 15 GeneralstaatsanwÃĪlte fordern die Sicherung der Beweise aus den VorfÃĪllen. In der EU gilt seit dem 2. August die volle Durchsetzung der Regeln fÞr Allzweck-KI aus dem EU AI Act, die Vorfall-Serie gilt dort als erster HÃĪrtetest der neuen Aufsicht.
Der grÃķÃte geplante Trainingslauf startet erst, wenn kleinere LÃĪufe und Tests die neuen SchutzmaÃnahmen bestÃĪtigt haben; einen Termin nennt OpenAI nicht. Mia Glaese, OpenAI-VizeprÃĪsidentin fÞr Forschung und dort fÞr Safety und Alignment zustÃĪndig, sagte dem Time Magazine, von Normalbetrieb sei das Unternehmen noch weit entfernt.
Update (25. August 2026): Trotz der Pause soll Astra bald erscheinen. Laut einem Leak nannte OpenAI intern einen Zeitraum von wenigen Wochen, wÃĪhrend der Wettmarkt Polymarket seine Erwartung fÞr einen Start Anfang September deutlich zurÞckgenommen hat. Die Belege zum Astra Release im September haben wir zusammengetragen.
Update (30. August 2026): Die TIME-Titelgeschichte vom 26. August liefert die Innensicht zu diesem Vorfall. Chefwissenschaftler Jakub Pachocki erfuhr im Krankenhaus davon, und OpenAI hatte passende Schutzwerkzeuge zwar gebaut, auf Modelle dieser FÃĪhigkeitsstufe aber nicht angewendet. Im selben Bericht kÞndigt Sam Altman ein internes System auf AGI-Niveau bis Jahresende an, nachzulesen im Artikel AGI bis Ende 2026.
Update (3. September 2026): Der pausierte groÃe Reinforcement-Learning-Lauf ist am 28. August wieder angelaufen, einzelne kleinere ExperimentierlÃĪufe bleiben gestoppt. Vier Tage spÃĪter erklÃĪrte OpenAI Astra zum ersten eigenen Modell mit kritischen CyberfÃĪhigkeiten. Die Messwerte dahinter und die neuen SchutzmaÃnahmen stehen im Bericht zur Astra Freigabe trotz Risikostufe Kritisch.