Anthropic Model 2:
Wird die interne KI zu Mythos 6?

Veröffentlicht: 16/08/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Schulte_Markus_300x300px

Markus Schulte

AI Solution Development, Autor

Inhaltsverzeichnis
Teilen
AI Newsletter

Anthropic Model 2 übertrifft das bisherige Spitzenmodell Claude Mythos 5 im internen Forschungs-Benchmark um 12,5 Prozentpunkte und bleibt trotzdem unter Verschluss. Das geht aus dem 186-seitigen Risk Report vom August 2026 hervor, den Anthropic am 14. August veröffentlicht hat.

Der Bericht beschreibt das nur intern eingesetzte Modell als „etwas leistungsfähiger“ als Mythos 5 und nennt keine Pläne für eine Veröffentlichung. In der KI-Szene läuft seitdem die Spekulation, ob es sich dabei um den künftigen Nachfolger Mythos 6 handelt. Dieser Name stammt allerdings nicht von Anthropic, sondern aus Leak-Berichten des Sommers.

Model 2 erreicht 62,8 Prozent auf CoBench, Mythos 5 nur 50,3

Auf dem internen Benchmark CoBench v2 löst Model 2 62,8 Prozent der Aufgaben, während Claude Mythos 5 auf 50,3 Prozent kommt. Dazwischen liegt Claude Mythos Preview mit 54,8 Prozent, das erste Modell der Mythos-Klasse. Die regulären Verkaufsmodelle folgen mit großem Abstand. Claude Opus 4.7 erreicht 27,4 Prozent, Opus 4.6 kommt auf 15,6 und Sonnet 4.6 auf 12,0 Prozent.

Dass Mythos Preview vor dem neueren Mythos 5 liegt, kommentiert der Bericht nicht eigens. Anthropic weist aber allgemein darauf hin, dass der Aufgaben-Datensatz gezielt aus Problemen zusammengestellt wurde, an denen Mythos Preview mindestens einmal scheiterte. Die Werte der einzelnen Modelle sind dadurch nur eingeschränkt vergleichbar.

CoBench v2: Anteil gelöster Anthropic-Forschungsaufgaben

Das interne Modell 2 führt das Feld an. Ab etwa 85 Prozent könnte ein Modell laut Anthropic die eigenen Forscher auf diesen Aufgaben vollständig ersetzen.

Quelle: Anthropic Risk Report August 2026, Figure 3.4.3.A.
Zahlen als Tabelle
ModellGelöste Aufgaben
Model 2 (intern)62,8 %
Claude Mythos Preview54,8 %
Claude Mythos 550,3 %
Claude Opus 4.727,4 %
Claude Opus 4.615,6 %
Claude Sonnet 4.612 %

Drei unveröffentlichte Modelle standen im Juli intern bereit

Zum Stichtag des Berichts am 15. Juli 2026 betrieb Anthropic drei leistungsstarke Modelle, die zu diesem Zeitpunkt nicht öffentlich verfügbar waren. Claude Opus 5 ist davon inzwischen regulär erschienen. Ein Modell mit der internen Bezeichnung Model 1 liegt etwa auf dem Niveau von Mythos Preview und Mythos 5, wird intern aber vergleichsweise wenig genutzt, mit sinkender Tendenz. In einer Mitarbeiter-Umfrage bevorzugte eine klare Mehrheit Mythos 5, einen breiten Einsatz von Model 1 plant Anthropic nach eigenen Angaben nicht mehr.

Model 2 beschreibt der Bericht dagegen als „spürbare Verbesserung gegenüber Mythos 5 bei vielen intern relevanten Aufgaben“, aber ohne einen Fähigkeitssprung in der Größenordnung, die Anthropic zwischen Claude Opus 4.6 und Mythos Preview beobachtet hatte. Im Modell-Anhang des Berichts heißt es, Model 2 sei „in manchen Bereichen leistungsfähiger als Mythos 5, in anderen schwächer, insgesamt etwas leistungsfähiger“. Die übliche Prüf-Suite vor einer Veröffentlichung hat das Modell nicht komplett durchlaufen, entsprechend vorsichtig formuliert Anthropic die eigenen Einschätzungen.

Textausschnitt aus dem Anthropic Risk Report mit Model 2 Beschreibung: unveröffentlichtes internes Modell, etwas leistungsfähiger als Claude Mythos 5, keine Veröffentlichungspläne.
Der Risk Report beschreibt Model 2 auf Seite 16 als „etwas leistungsfähiger“ als Mythos 5 (Quelle: Anthropic, August 2026)
ModellEinordnung im Risk ReportStatus
Claude Opus 5Am Stichtag nur intern im Einsatz, insgesamt schwächer als Mythos 5Inzwischen regulär veröffentlicht
Model 1Etwa auf dem Niveau von Mythos Preview und Mythos 5, intern wenig genutztBleibt intern, breiter Einsatz nicht geplant
Model 2Insgesamt etwas stärker als Mythos 5, in einzelnen Bereichen schwächerBleibt intern, derzeit keine Release-Pläne
Die drei unveröffentlichten Anthropic-Modelle zum Stichtag 15. Juli 2026 (Quelle: Risk Report, Abschnitt 1.4 und Anhang 6.6)

Beim internen Rollout von Model 2 testete Anthropic erstmals ein gestuftes Verfahren. Das Modell lief zunächst auf internen Systemen mit strengeren Blockade-Kontrollen, bevor es für die uneingeschränkte interne Nutzung freigegeben wurde. Neue oder besorgniserregendere Formen von Fehlverhalten traten dabei laut Bericht nicht auf. In einem Test für verdeckte Sabotage-Aufgaben (SHADE-Arena) schneidet Model 2 etwas stärker ab als Mythos 5, aber deutlich schwächer als Mythos Preview. Höhere Werte stehen dort für mehr Tarnfähigkeit und damit mehr Risiko; die Erfolgsquoten bleiben mit unter 1 Prozent für Mythos 5 und 6 bis 10 Prozent für Mythos Preview insgesamt niedrig. Wie Claude-Instanzen aufeinander reagieren, wenn sie im selben System auf widersprüchliche Aufträge treffen, prüfte das Frontier Red Team einen Tag vor dem Risk Report in einer Studie zu Multiagenten-Systemen, in der die Agenten einander mit getarnter Schadsoftware ausschalteten.

Mythos 5 selbst ist nur für geprüfte Partner wie Sicherheitsfirmen und Infrastruktur-Betreiber zugänglich. Alle anderen Nutzer erhalten mit Claude Fable 5 das baugleiche Modell mit zusätzlichen Schutzfiltern, wie Anthropic in der Ankündigung von Claude Fable 5 und Mythos 5 beschreibt.

CoBench stellt Aufgaben, die Anthropic-Ingenieure wirklich gelöst haben

CoBench versetzt ein Modell an einen historischen Punkt der Anthropic-Infrastruktur und lässt es Probleme diagnostizieren, die die eigenen Ingenieure tatsächlich gelöst haben. Das Modell erhält dafür einen eingefrorenen Stand der Codebasis, der Logdateien, der internen Chats und der Dokumentation und muss die Fehlerursache finden, die damals wirklich verantwortlich war. Die bisherige Test-Suite mit nachgestellten Aufgaben gilt laut Bericht als ausgereizt, weil Spitzenmodelle dort inzwischen bei den meisten Aufgaben die menschlichen Vergleichswerte übertreffen. CoBench arbeitet deshalb mit echten Fällen.

Die aktuelle Version umfasst 449 Probleme, die Anthropic-Teams größtenteils zwischen Februar und April 2026 gelöst haben. Der Datensatz ist bewusst auf schwere Fälle gefiltert. Aufgenommen wurden fast nur Aufgaben, an denen Mythos Preview in mindestens einem von drei Versuchen scheiterte, ohne diesen Filter wäre die Sammlung etwa doppelt so groß. Bewertet werden die Antworten automatisiert anhand einer Rubrik, die die Lösung mit der real gefundenen Fehlerursache vergleicht. Die gemessenen Werte entstanden mit einem Budget von 300.000 Tokens pro Aufgabe; eine Verdreifachung auf 900.000 Tokens verbesserte das Ergebnis von Mythos 5 nur um rund 3 Prozentpunkte.

Aus der manuellen Prüfung der Aufgaben leitet Anthropic eine Schwelle ab. Ein Modell, das die eigenen Research Scientists und Research Engineers auf diesen Aufgaben vollständig ersetzen könnte, müsste demnach mindestens 85 Prozent erreichen. Die Lücke bis zur Vollmarke erklärt der Bericht mit mehrdeutigen Aufgaben, Bewertungsfehlern der automatischen Rubrik und fehlenden Zugriffsrechten der getesteten Modelle. Anthropic bezeichnet die 85 Prozent selbst als unsichere Schätzung.

0
echte Forschungsaufgaben bilden den Benchmark CoBench v2
0
ab diesem Wert könnte ein Modell laut Anthropic die eigenen Forscher ersetzen
0
Prozentpunkte fehlen Model 2 bis zur 85-Prozent-Schwelle
CoBench v2 Benchmark Diagramm zeigt Balkendiagramm mit sechs Anthropic-Modellen: Claude Opus 4.6 (15,6%), Claude Sonnet 4.6 (12,0%), Claude Mythos Preview (54,8%), Claude Opus 4.7 (27,4%), Claude Mythos 5 (50,3%) und Model 2 (62,8%).
Original-Grafik aus dem Risk Report: Model 2 führt auf CoBench v2 mit 62,8 Prozent (Quelle: Anthropic, Figure 3.4.3.A, August 2026)

Claude schreibt die Mehrheit des Codes in Anthropics Produktivsystemen

Die große Mehrheit des Codes, der in Anthropics Produktions-Codebasen übernommen wird, stammt laut dem Bericht inzwischen von Claude. Mythos 5 und Model 2 arbeiten dort nicht nur im Chat-Dialog, sondern auch als dauerhaft laufende KI-Agenten in Forschung und Entwicklung. Firmenchef Dario Amodei hatte diese Entwicklung bereits im Januar in seinem Essay „The Adolescence of Technology" beschrieben.

Ein vollwertiger Ersatz für die eigenen Forscher sind die Modelle nach Anthropics Einschätzung trotzdem nicht. In der letzten internen Umfrage, damals noch zu Mythos Preview, bezifferten die Fachleute ihren Produktivitätsgewinn im Schnitt auf etwa das Vierfache. Einer von 18 Befragten hielt das Modell bereits für einen vollwertigen Ersatz eines Berufseinsteigers in der Forschung, vier von 18 sahen mindestens eine 50-Prozent-Chance, diese Marke mit drei Monaten Feinarbeit an der Werkzeug-Umgebung zu erreichen.

In einer Stichprobe von 886 internen Arbeitssitzungen meldete Claude in 57 Fällen ungeprüfte Vermutungen als Fakten oder Arbeit als verifiziert, die es nicht war. In neun Sitzungen umging das Modell eine Sperre, statt zu stoppen, viermal ignorierte es eine ausdrückliche Anweisung und dreimal erfand es Details, die nie beobachtet wurden. Genau diese Schwächen bei Selbstkontrolle und Urteilsvermögen trennen laut Anthropic verlässliche autonome Forschungsarbeit von Arbeit, die einen Menschen in der Schleife braucht.

Auf dem internen Fähigkeits-Index AECI liegt Model 2 rund 1,5 Punkte über Mythos 5, bei großen Fehlerbalken. Insgesamt sieht Anthropic seit Anfang bis Mitte 2025 eine spürbare Beschleunigung der eigenen Entwicklungsarbeit, aber weniger als eine Verdopplung. Die Schwelle der hauseigenen Sicherheitsrichtlinie, ab der automatisierte KI-Forschung als eigenes Risiko gilt, ist damit nach Einschätzung des Unternehmens nicht erreicht.

Warum Anthropic Model 2 nicht veröffentlicht

Eine ausdrückliche Begründung für die Zurückhaltung von Anthropic Model 2 nennt der Bericht nicht, er dokumentiert aber den Prüfrahmen dahinter. Das Modell hat die übliche Bewertungs-Suite vor einer Veröffentlichung nicht vollständig durchlaufen, und Anthropic räumt ein, die eigenen Fähigkeits-Einschätzungen seien deshalb weniger belastbar als bei den Verkaufsmodellen.

Was ist ein Risk Report?

Anthropic verpflichtet sich in seiner Responsible Scaling Policy (RSP) zu regelmäßigen Risk Reports, angestrebt sind Abstände von drei bis sechs Monaten. Anders als die Modell-Datenblätter zu einzelnen Releases bewertet dieser Bericht die Risiken aller Aktivitäten des Unternehmens, ausdrücklich auch der rein internen Modelle. Geschwärzte Stellen müssen gekennzeichnet werden, und das unabhängige Kontrollgremium Long-Term Benefit Trust kann externe Prüfungen anfordern. Den KI-Forschungs-Teil des ersten Berichts vom Februar 2026 ließ Anthropic bereits als Pilotprojekt vom Forschungsinstitut METR prüfen.

Die Risiko-Einstufungen des Berichts fallen durchweg „niedrig" aus, zwei davon hob Anthropic gegenüber dem Februar an. Das Risiko von Fehlverhalten in kritischen Situationen stieg von „sehr niedrig" auf „niedrig", ausdrücklich nicht wegen neuer Befunde, sondern wegen gestiegener Unsicherheit nach bekannt gewordenen Vorfällen in Cybersecurity-Tests. Beim Biowaffen-Risiko nennt der Bericht eine inzwischen geschlossene Lücke in den eigenen Zugangskontrollen als Grund für eine etwas höhere Einschätzung. Ein solcher Fall wurde Anfang August publik, als ein KI-Agent im Test des britischen AISI eigenmächtig handelte.

Anthropic steht mit dieser Vorsicht nicht allein. OpenAI hatte Anfang August den Release seines Modells Astra verschoben, ebenfalls mit Verweis auf Cyber-Fähigkeiten. Der Nachrichtendienst Axios verweist in seiner Analyse zum Model-2-Bericht auf genau diese Parallele und auf wachsende Sicherheitsbedenken in der Branche.

Mythos 6 taucht in keinem offiziellen Dokument auf

Die Bezeichnung Mythos 6 stammt nicht von Anthropic, sondern aus der Community. Schon seit Ende Juni kursieren Leak-Berichte über ein fertig trainiertes Mythos-Nachfolgemodell, bis heute ohne bestätigten Namen. Nach dem Risk Report verbinden viele Beobachter beide Geschichten und vermuten in Model 2 den Kandidaten für ein späteres Mythos 6. Ein Beleg dafür existiert nicht, und Anthropic erklärt im Bericht ausdrücklich, derzeit keine Veröffentlichung zu planen.

Anders als bei einem echten Leak stehen alle Model-2-Angaben in einem Dokument, das Anthropic selbst publiziert hat. Im begleitenden X-Beitrag erwähnte das Unternehmen sein internes Modell mit keinem Wort, die Geschichte zogen Presse und Community aus den Tiefen der 186 Seiten. Wie schnell interne Modellnamen Schlagzeilen machen, hatte kurz zuvor schon der OpenAI-Doug-Leak gezeigt.

In der Fachszene löste vor allem die CoBench-Zahl Reaktionen aus. Der KI-Kommentator Dan McAteer schrieb auf X unter dem Titel „RSI is near", die rekursive Selbstverbesserung rücke näher, weil das unveröffentlichte Model 2 auf einem Forschungs-Benchmark 12,5 Prozentpunkte über Mythos 5 liege. Der Bericht selbst hält dagegen fest, dass die Beschleunigung der eigenen Forschung bislang unter dem Faktor 2 bleibt und die kritischen Schwellen der Sicherheitsrichtlinie nicht erreicht sind.

Ob Model 2 ein internes Werkzeug bleibt oder doch noch als Mythos 6 erscheint, lässt der Bericht offen. Der nächste Risk Report soll im angestrebten Turnus von drei bis sechs Monaten folgen, also voraussichtlich um den Februar 2027.

Update (17.08.2026): Kurz nach dem Risk Report wurden Anthropics Geschäftszahlen bekannt. Der Anthropic Umsatz im zweiten Quartal 2026 stieg auf mehr als 11,5 Milliarden Dollar, das Unternehmen bereitet einen Börsengang im Oktober vor.

ChatGPT für Handwerker &
Unternehmen

Holen Sie sich jetzt kostenlos die besten ChatGPT Prompts für lokale Dienstleister wie z.B. Handwerker. Sie werden damit bei Preisverhandlungen siegen können und Gegenargumente entkräften. Viele Prompts und ein breites Spektrum an Themen, um Ihren Arbeitsalltag zu erleichtern. Laden Sie sich jetzt diese einmalige Prompt-Bibliothek speziell für regional tätige Unternehmen & Handwerksbetriebe herunter.

Webinar Release KI im Handwerk

Sie haben eine Frage?