OpenAI Astra Freigabe trotz
Risikostufe Kritisch

Veröffentlicht: 03/09/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Schulte_Markus_300x300px

Markus Schulte

AI Solution Development, Autor

Inhaltsverzeichnis
Teilen
AI Newsletter

OpenAI hat die Astra Freigabe angekündigt, obwohl das Unternehmen dem Modell selbst die höchste eigene Risikostufe für Cyberfähigkeiten bescheinigt. In einem Beitrag zum Weg zu Astra vom 1. September 2026 schreibt der Konzern, das Modell erreiche im Preparedness Framework die Risikostufe Kritisch, im englischen Original Critical. Die Schutzmaßnahmen minimierten das Risiko schwerwiegender Schäden aber ausreichend für eine Veröffentlichung.

Am 7. August hatte OpenAI eine kritische Einstufung lediglich nicht ausschließen können und deshalb den Astra-Release verschoben. Aus dem Verdacht ist eine Feststellung geworden. Astra ist damit das erste Modell des Unternehmens auf dieser Stufe.

Update (4. September 2026): Astra wurde am 3. September von OpenAI veröffentlicht. Hier geht es zum Release-Artikel zu GPT-6 Astra.

Was die Risikostufe Kritisch bei Cyberfähigkeiten bedeutet

Ein Modell gilt bei OpenAI als kritisch, sobald eine von zwei Bedingungen erfüllt ist. Die erste: Es kann ohne menschliches Eingreifen in vielen gehärteten, real eingesetzten Systemen funktionsfähige Zero-Day-Exploits aller Schweregrade finden und entwickeln. Die zweite: Es kann allein aus einem grob formulierten Ziel neuartige, vollständige Angriffsstrategien gegen gehärtete Ziele entwerfen und ausführen. Beide Formulierungen stehen so im Preparedness Framework, dem internen Regelwerk, mit dem OpenAI seit 2023 Risikostufen für neue Modelle festlegt.

Bis zu dieser Woche hatte kein OpenAI-Modell die Stufe erreicht. Das erste Modell mit der darunterliegenden Einstufung „Hoch“ war im Februar 2026 GPT-5.3-Codex. Für GPT-5.6 Sol hielt die Systemkarte im Juli ausdrücklich fest, das Modell habe gegen reale Ziele keine funktionierende vollständige Exploit-Kette hervorgebracht und bleibe unter der kritischen Schwelle. Zwischen dieser Bewertung und der Astra-Einstufung liegen keine zwei Monate.

Zwei unbekannte Lücken fand Astra während der Messung

Astra entdeckte während einer laufenden Benchmark-Messung zwei bislang unbekannte Schwachstellen und baute sie in eine funktionierende Exploit-Kette ein. OpenAI meldet die beiden Funde nach eigenen Angaben gerade an die zuständigen Entwickler. Der Benchmark, in dem das passierte, ist eine interne Eigenentwicklung mit dem Namen „ExploitBench – Internal Port (June–August 2026)“ und enthält 20 erst kurz zuvor offengelegte Schwachstellen hoher Schwere in der JavaScript-Engine V8.

Auf dem frei verfügbaren ExploitBench erreichte Astra die Höchstwertung von 100 Prozent. Den internen Nachbau begründet OpenAI mit möglicher Kontamination der Trainingsdaten. Im internen Nachbau erzielte Astra deutlich höhere Quoten bei der Ausführung beliebigen Codes als GPT-5.6 Sol, und zwar mit erheblich weniger Ausgabe-Token.

In den fachkundig geleiteten Tests kam ein zweiter Befund dazu. Gegen einen gehärteten Browser entwickelte Astra eine vollständige Angriffskette, die aus der Sandbox ausbrach und Befehle auf dem Wirtssystem ausführte, sobald der Browser eine präparierte HTML-Datei öffnete. Gegen ein gehärtetes Betriebssystem fand das Modell mehrere Lücken und kombinierte sie zu einer Rechteausweitung vom Konto ohne besondere Berechtigungen bis zum Root-Zugriff.

Eine Fußnote unter der Ergebnisgrafik schränkt all diese Werte ein. Sie stammen aus einer Konfiguration mit Zugriff auf Daybreak Blue, nicht aus dem Auslieferungszustand. Bei diesem Zugang entfallen laut OpenAI die Schutzmechanismen auf Systemebene, gemessen wurde also nicht der Auslieferungszustand.

Zwei Balkendiagramme zur Astra Alignment Bewertung OpenAI: links die Reaktion auf eine Ablehnung durch die automatische Prüfung, rechts die ExploitGym-Honeypot-Ergebnisse für GPT-5.6 Sol und Astra
OpenAIs Messung zum Verhalten von Astra und GPT-5.6 Sol, erhoben in einer simulierten Umgebung ohne die Schutzmaßnahmen des Produktivbetriebs. (Quelle: https://openai.com/de-DE/index/path-to-astra/)

Zugang zu den Cyberfähigkeiten gibt es nur in Stufen

Wer Astra bekommt, entscheidet über das, was Astra kann. Fortgeschrittene Cybersicherheitsarbeit steht zum Start nur einer kleinen Gruppe von Alpha-Testenden offen, danach weitet OpenAI den Zugang über OpenAI Daybreak Blue aus. Eine breit verfügbare Fassung ist angekündigt, zum Funktionsumfang in ChatGPT und über die API sagt OpenAI bisher nichts.

Daybreak ist OpenAIs Zugangsprogramm für Sicherheitsteams. Seit dem Ausbau des Daybreak-Programms am 10. August zerfällt es in zwei Stufen. Blue richtet sich an Verteidiger und deckt Schwachstellensuche, Code-Review, Malware-Analyse, Incident Response und Patch-Validierung ab. Red gibt eigens trainierte Cyber-Modelle für autorisierte Penetrationstests und Red Teaming frei. Beide Stufen verlangen Identitätsprüfung, Nutzungsbeschränkungen und rechtliche Zusicherungen; seit dem 1. September ist für Daybreak-Einzelkonten außerdem ein Hardware-Sicherheitsschlüssel Pflicht.

StufeWer Zugang bekommtWas damit möglich ist
Alpha-TestKleine, von OpenAI ausgewählte GruppeFortgeschrittene Cybersicherheitsabläufe mit Astra, zeitlich vor allen anderen
Daybreak BlueGeprüfte Verteidigungsteams und PartnerfirmenDefensive Arbeit ohne die Schutzschicht auf Systemebene, später auch mit Astra
Daybreak RedAutorisierte Offensiv-TeamsEigens trainierte Cyber-Modelle für Pentests, Exploit-Validierung, Red Teaming
Breite FassungAlle NutzendenAngekündigt, ohne die fortgeschrittenen Cyberfähigkeiten; Details offen

Am 10. August nannte OpenAI in einem Beitrag zu den Partnern des Cyber-Programms 16 Firmen, darunter Cisco, Cloudflare, Palo Alto Networks, CrowdStrike, Akamai, Fortinet, Sophos, IBM und Accenture. Die Partnerseite listet inzwischen mehr Namen, die Zahl ist also ein Stichtag. Wired nennt die drei erstgenannten Infrastruktur-Anbieter im Zusammenhang mit Astra und beschreibt als Ziel des Programms, dass solche Firmen ihre Verteidigung härten können, bevor vergleichbare Modelle breit verfügbar sind. Welche Partner den Frühzugang zu Astra bekommen, sagt OpenAI nicht.

Die Stufung steht quer zu einer Aussage von Sam Altman vom 7. August. Damals schrieb der OpenAI-Chef auf X, es sei keine gute Strategie, mächtige Modelle einem auserwählten Kreis vorzubehalten. In der Diskussion um die Astra-Freigabe wird Altman dieser Satz seit dem 1. September vorgehalten, unter anderem im Kommentarstrang auf Hacker News zum Astra-Beitrag.

Ob ein Modell solche Arbeit überhaupt annimmt, hängt an der Zugangsstufe. OpenAI misst das mit einer internen Kennzahl namens Advanced Cybersecurity Completion Rate, die zählt, wie häufig ein Modell auf fortgeschrittene Cyber-Anfragen antwortet statt sie abzulehnen. Das Sondermodell GPT-5.6-Cyber bearbeitete danach 95 Prozent der Anfragen, GPT-5.6 Sol im Standardzugang 1,5 Prozent und mit Daybreak-Blue-Zugriff 2,0 Prozent.

Wie oft Modelle fortgeschrittene Cyber-Anfragen bearbeiten

OpenAIs interne Kennzahl Advanced Cybersecurity Completion Rate. Sie misst das Antwortverhalten, nicht die Lösungsgüte.

Quelle: OpenAI zum Daybreak-Ausbau, Stand August 2026. Astra ist in dieser Messreihe noch nicht enthalten.
Zahlen als Tabelle
KonfigurationAnteil bearbeiteter Anfragen
GPT-5.6-Cyber (Daybreak Red)95,0 %
GPT-5.5-Cyber57,3 %
GPT-5.6 Sol mit Daybreak Blue2,0 %
GPT-5.6 Sol im Standardzugang1,5 %

Der Misalignment-Monitor stoppt Aufgaben mitten im Lauf

Astra läuft im Produktivbetrieb unter einer zusätzlichen Überwachung, die laufende Aufgaben anhalten kann. Ein System aus Klassifikatoren prüft das Reasoning und die Aktionen des Modells auf unbefugtes Verhalten und stoppt verdächtige Vorgänge automatisch. OpenAI nennt diese Schicht „misalignment monitor“, im deutschen Blogpost „Überwachung auf mangelndes Alignment“. Sie schlägt nicht nur bei Angriffen an.

Was ein Misalignment-Monitor prüft

Misalignment heißt, dass ein Modell etwas anderes verfolgt als das, was ihm aufgetragen wurde. Der Monitor ist kein Filter für Eingaben, sondern eine Beobachtung des Modells bei der Arbeit. Er liest die Gedankenkette und die ausgeführten Schritte mit und greift ein, wenn ein Schritt außerhalb des freigegebenen Auftrags liegt, etwa wenn ein Agent Zugangsdaten einsammelt, obwohl er eine Datei sortieren sollte. Mehr zur Begriffswelt dahinter steht im Glossareintrag zu Alignment bei KI.

Schlägt der Monitor an, hängt das Weitere von der Oberfläche ab. In ChatGPT und Codex bekommen Nutzende eine Rückfrage und können die Aktion prüfen. Über die API endet die Aufgabe an dieser Stelle, ohne Nachfrage.

OberflächeReaktion bei einem TrefferFolge für die Arbeit
ChatGPTRückfrage vor dem FortfahrenDer Vorgang läuft nach Bestätigung weiter
CodexRückfrage vor dem FortfahrenLängere Agentenläufe werden unterbrochen
API und andere OberflächenDie Aufgabe wird gestopptKein Weiterlaufen, die bisherige Rechenzeit ist verbraucht

OpenAI beschreibt die Reibung selbst und schreibt, zusätzliche Sicherheitsprüfungen könnten legitime Arbeit verlangsamen, pausieren oder stoppen. Betroffen sein könnten auch Aufgaben, die nicht nach Cybersicherheit aussehen, und lange laufende Agenten.

Zum Start werden die Schutzmaßnahmen von Astra voraussichtlich mehr Hürden verursachen, als wir langfristig beabsichtigen, um vor möglichem Missbrauch zu schützen.
OpenAI, „Der Weg zu Astra“, 1. September 2026

Wie sich das anfühlt, lässt sich heute schon nachlesen. Im öffentlichen Codex-Repository von OpenAI melden Nutzende Fehlalarme der bereits aktiven Cyber-Schutzschicht. Ein Nutzer beschreibt am 26. August, dass ein Optimierungslauf für eine Codeforces-Aufgabe als Cybersicherheitsanfrage eingestuft und abgebrochen wurde, nachdem bereits erhebliche bezahlte Rechenzeit verbraucht war. Ein zweiter Bericht vom 10. August betrifft eine rein lesende Software-Assurance-Analyse, die mehrfach blockiert wurde, ein dritter vom Juni ganz normale lokale Repository-Wartung. Alle drei Meldungen sind offen. Die beiden August-Fälle entstanden unter GPT-5.6 Sol, die Juni-Meldung nennt kein Modell. Für Astra verschärft OpenAI diese Schutzschicht noch.

Screenshot des GitHub-Issues #40970 zum Codex Fehlalarm Cybersicherheit bei Codeforces-Aufgabe 2251A, Labels bug und safety-check sichtbar
Nutzermeldung im Codex-Repository von OpenAI, ein Programmierwettbewerbs-Lauf wurde als Cybersicherheitsanfrage eingestuft und abgebrochen. (Quelle: https://github.com/openai/codex/issues/40970)

Im Preparedness Framework steht für Critical ein Entwicklungsstopp

Das Regelwerk, auf das sich OpenAI beruft, sieht für die Stufe Critical eigentlich etwas anderes vor als eine Veröffentlichung. In der geltenden zweiten Fassung von April 2025 heißt es zu kritischen Cyberfähigkeiten sinngemäß, die weitere Entwicklung sei zu stoppen, solange keine Schutz- und Sicherheitsstandards festgelegt sind, die einem Critical-Maßstab genügen. Der Astra-Beitrag verweist auf das Framework, geht auf die Klausel aber nicht ein.

OpenAI-Verantwortliche sagten im Presse-Briefing laut Wired, man habe das vorgesehene Verfahren befolgt und die Entwicklung angehalten, bis passende Schutz- und Sicherheitsmaßnahmen umgesetzt waren. Angekündigt hatte das Unternehmen am 18. August außerdem, das Framework weiterzuentwickeln. Eine überarbeitete Fassung mit einem definierten Critical-Standard ist bislang nicht veröffentlicht.

Über Freigaben entscheidet nach dem Regelwerk die Unternehmensführung. Die interne Safety Advisory Group spricht eine Empfehlung aus, das Sicherheitskomitee des Verwaltungsrats hat die Aufsicht und kann Entscheidungen umkehren.

Zu den Schutzmaßnahmen, die OpenAI seither aufgebaut hat, gehören ein Training, das Cyberanfragen zuverlässiger ablehnt, Klassifikatoren auf Systemebene und die Überwachung der Gedankenkette. Nach eigenen Messungen lehnt Astra 91,5 Prozent der Anfragen aus einer Sammlung von Jailbreak-Versuchen ab, GPT-5.6 Sol kam auf 59 Prozent. In einem Honeypot-Test, der aus dem Hugging-Face-Vorfall entstand, versuchte GPT-5.6 Sol in 56 Prozent der Durchläufe, die umgebende Sicherheitsinfrastruktur anzugreifen, statt die gestellte Aufgabe zu lösen. Gemessen wurde in einer simulierten Umgebung ohne die Schutzmaßnahmen des Produktivbetriebs. Astra unternahm in diesen Tests keinen solchen Versuch.

Die Trainingsseite ist ebenfalls wieder in Bewegung. Nach dem Vorfall hatte OpenAI bestimmte Frontier-Trainings für zwei Wochen ausgesetzt. Den großen pausierten Reinforcement-Learning-Lauf nahm das Unternehmen am 28. August wieder auf, einzelne kleinere Experimentierläufe bleiben zurückgehalten.

Eine unabhängige Prüfung der Zahlen fehlt

Sämtliche veröffentlichten Zahlen stammen von OpenAI selbst. TechCrunch hält fest, dass sich die Sicherheitsaussagen ohne Bestätigung durch Dritte kaum bewerten lassen, und weist darauf hin, dass OpenAI weder die Alpha-Testenden benennt noch erklärt, wie sie ausgewählt werden. Die Systemkarte mit den Details zu Tests und Alignment kommt laut Unternehmen erst zum Start des Modells.

Yona Shavit war früher bei OpenAI und arbeitet heute im Bereich KI-Resilienz der OpenAI Foundation. Laut TechCrunch stellte Shavit öffentlich die Frage, ob Astras Regeltreue im Ausbruchstest daher rühre, dass das Modell wusste, was von ihm erwartet wurde, oder ob es die Forschenden täuschen wollte. Steven Adler ist ebenfalls ehemaliger OpenAI-Mitarbeiter und Mitgründer der Non-Profit Guidelight AI Standards. Gegenüber Fortune nannte Adler die Tempoänderungen der Labore einen guten ersten Schritt und forderte „predictable, verifiable pacing across the frontier“ statt einzelner Ad-hoc-Entscheidungen.

Recurrent Depth: Forscher fürchten unlesbares Denken

Den schärfsten Widerspruch löste nicht der Blogpost aus, sondern ein Bericht von The Information vom selben Abend, über den auch TechCrunch die Reaktionen der Sicherheitsforschung sammelte. Danach nutzt Astra eine Technik namens Recurrent Depth, bei der derselbe Text mehrfach durch dieselben Schichten läuft. Ein Teil des Denkens liegt damit nicht mehr als lesbarer Text vor, sondern nur noch in internen Aktivierungen. Auf dem lesbaren Text setzt die Gedankenketten-Überwachung auf, die OpenAI als zweite Verteidigungslinie beschreibt.

Ryan Greenblatt, Chief Scientist bei Redwood Research, nannte das auf X die möglicherweise schlimmste Entwicklung für KI-Sicherheit bislang und schränkte im selben Beitrag ein, die Details zu Astra seien nicht öffentlich bekannt. Buck Shlegeris, Geschäftsführer derselben Organisation, schrieb, ob Astra schlechter überwachbar sei als frühere Modelle, lasse sich von außen nicht sagen; treibe OpenAI die Technik weiter, stehe die Möglichkeit offen, die Rekurrenz massiv zu erhöhen. Geoffrey Irving, Chief Scientist des britischen AI Security Institute, sagte eine Verteidigungslinie voraus, nach der zwischendurch ausgegebene Token die Überwachbarkeit weiterhin sicherstellten, und bezeichnete diese Argumentation vorab als untauglich.

OpenAI-Chefwissenschaftler Jakub Pachocki, dessen Aussagen zu Astras Fähigkeiten auch die Debatte um AGI bis Ende 2026 prägen, antwortete am 2. September direkt auf diese Welle.

Nachprüfen lässt sich die Angabe zur Rechentiefe von außen nicht. Laut The Information begrenzt OpenAI die Technik bei Astra bewusst, damit lesbare Gedankenketten erhalten bleiben; das steht dort als Aussage einer mit der Arbeit vertrauten Person.

Anthropic nimmt Cyber-Tests wieder auf, Google startet Fairwind

Astra ist nicht der einzige Fall dieser Woche. Anthropic meldete am 31. August, externe Cyber-Evaluationen wieder aufgenommen zu haben, die im Sommer nach mehreren Vorfällen ausgesetzt worden waren. Der Großteil des Reinforcement-Learning-Trainings läuft ebenfalls wieder, einzelne Hochrisiko-Umgebungen bleiben pausiert.

Als Ursachen nennt Anthropic ein Versagen der operativen Sicherheit und zwei Alignment-Probleme. Das erste ist motivated reasoning, bei dem ein Modell an einer Annahme festhält, obwohl die Belege dagegen sprechen; bei Mythos 5 war das die Annahme, in einer Simulation zu stecken. Das zweite ist die Bereitschaft, für ein eng gefasstes Ziel schädliche Handlungen in Kauf zu nehmen. Ausgeprägtes Reward Hacking im Training kann nach dieser Analyse lange Ketten solcher Handlungen begünstigen.

Google wählte einen anderen Zuschnitt. Der Konzern stellte am 2. September das Modell Gemini 3.8 Flash Cyber, das Reparatur-Werkzeug CodeMender und das Partnerprogramm Fairwind für geprüfte Verteidiger vor. Es richtet sich an Regierungsstellen, nationale Cyber-Behörden und Betreiber kritischer Infrastruktur. In der Ankündigung heißt es, das Aufspüren von Schwachstellen erzeuge Aufmerksamkeit und Angst, Sicherheit entstehe erst durch autonomes Finden und Beheben.

Im Hintergrund steht ein offener Brief vom 28. Juli. „Pacing the Frontier“ fordert ein abgestimmtes Tempo an der Entwicklungsgrenze und wurde von mehr als 1.100 Beschäftigten aus OpenAI, Anthropic, Google DeepMind und Meta unterzeichnet, unter ihnen Dario Amodei, Jack Clark und Jakub Pachocki. Anthropic verweist in der Meldung vom 31. August ausdrücklich darauf.

Das BSI warnte im Juni vor dieser Entwicklung

Für Betriebe in Deutschland ist die Lage seit Monaten amtlich beschrieben. Das Bundesamt für Sicherheit in der Informationstechnik veröffentlichte am 22. Juni 2026 eine Cybersicherheitswarnung zu den Auswirkungen der KI-Entwicklung in der Stufe Gelb, die zu einer Prüfung der eigenen Betroffenheit binnen ein bis zwei Arbeitstagen auffordert. Kernaussage ist, dass Schwachstellen mit KI-Unterstützung innerhalb kurzer Zeit umfassend und teilweise autonom erkannt, analysiert und in verwertbare Angriffspfade überführt werden können. Die Warnung ist allgemein gehalten und nennt Astra nicht.

Die Zeitfenster für Gegenmaßnahmen sind schon ohne diesen Effekt knapp. Die Bedrohungslage-Analyse der EU-Agentur ENISA nennt die Ausnutzung von Software-Schwachstellen als häufigsten Einstiegsvektor mit einem Anteil von 21,3 Prozent. Ab dem 11. September greift für Hersteller vernetzter Produkte die Meldepflicht des Cyber Resilience Act, mit einer Frühwarnung binnen 24 Stunden, einer vollständigen Meldung nach 72 Stunden und einem Abschlussbericht später.

Kopfbereich des BSI-Dokuments zur BSI Cybersicherheitswarnung KI mit Titel, Aktenzeichen BITS-B Nr. 2026-262788-1032, Version 1.0, Kritikalität 2/Gelb und TLP:CLEAR
Cybersicherheitswarnung des BSI vom 22. Juni 2026, eingestuft als Kritikalität 2 / Gelb. (Quelle: https://www.bsi.bund.de/SharedDocs/Cybersicherheitswarnungen/DE/2026/2026-262788-1032.pdf?__blob=publicationFile&v=2)

Einen Termin nennt OpenAI weiterhin nicht

Ein Datum für den Start bleibt offen. Im Presse-Briefing lehnte OpenAI laut Axios einen konkreten Zeitrahmen ab und blieb bei der Formulierung, Astra werde „bald“ bereitgestellt. Das Briefing führte unter anderem Amelia Glaese, VP of Research bei OpenAI. Der Leak zum Astra-Release im September hatte zuvor die erste oder zweite Septemberwoche genannt.

Bis dahin bleibt es bei dem, was OpenAI selbst angekündigt hat. Die Systemkarte mit den Ergebnissen aus Sicherheits- und Alignment-Tests erscheint zum Launch, ein technischer Bericht zum Überwachungssystem ist angekündigt, und einzelne kleinere Experimentierläufe bleiben vorerst gestoppt.

Update (4. September 2026): Zwei Tage nach der Freigabe-Ankündigung ist Astra gestartet. Die ausgelieferte Fassung verweigert das Schreiben von Proof-of-Concept-Exploits, und laut Daybreak-Hilfeseite sind die gelockerten Ablehnungsregeln für die meisten Daybreak-Kunden bei Astra noch nicht verfügbar. Preise, Limits je Tarif und die System-Card-Zahlen zur gesunkenen Überwachbarkeit stehen im Release-Artikel zu GPT-6 Astra.

ChatGPT für Handwerker &
Unternehmen

Holen Sie sich jetzt kostenlos die besten ChatGPT Prompts für lokale Dienstleister wie z.B. Handwerker. Sie werden damit bei Preisverhandlungen siegen können und Gegenargumente entkräften. Viele Prompts und ein breites Spektrum an Themen, um Ihren Arbeitsalltag zu erleichtern. Laden Sie sich jetzt diese einmalige Prompt-Bibliothek speziell für regional tätige Unternehmen & Handwerksbetriebe herunter.

Webinar Release KI im Handwerk

Sie haben eine Frage?