Glossareintrag
Wir denken. KI tippt mit.
Die Responsible Scaling Policy (RSP, sinngemäß „Richtlinie für verantwortungsvolles Hochskalieren“) ist das freiwillige Sicherheits-Regelwerk des KI-Unternehmens Anthropic, dem Hersteller von Claude. Es legt fest, ab welchen gefährlichen Fähigkeiten ein neues KI-Modell nur noch mit zusätzlichen Schutzmaßnahmen trainiert oder veröffentlicht werden darf und welche Maßnahmen das sind. Kern der RSP sind die AI Safety Levels (ASL), gestufte Sicherheitsstandards von ASL-1 bis ASL-4 (nach oben offen). Anthropic hat sie nach eigener Angabe an die Biosicherheitsstufen (BSL) für den Umgang mit gefährlichen Krankheitserregern angelehnt.
Der Name ist ein Eigenname von Anthropic, das Prinzip dahinter dagegen nicht. Das Konzept stammt vom Prüfinstitut METR (damals ARC Evals), das es gemeinsam mit Anthropic entwickelte und am 26. September 2023 als allgemeine Bauanleitung für solche Regelwerke veröffentlichte. Anthropic hatte eine Woche zuvor, am 19. September 2023, als erstes Unternehmen eine eigene RSP veröffentlicht, die erste Sicherheitsrichtlinie dieser Art überhaupt. Die Konkurrenz zog mit eigenen Namen nach, OpenAI mit dem Preparedness Framework, Google DeepMind mit dem Frontier Safety Framework. Als Oberbegriff für die ganze Gattung hat sich Frontier AI Safety Framework eingebürgert, weil sie sich auf Frontier-Modelle bezieht, also die jeweils leistungsstärksten KI-Systeme.
Anthropic bezeichnet die RSP selbst als „lebendes Dokument“. Aktuell gilt Version 3.4 vom 8. Juli 2026. Die Liste aller Fassungen samt Änderungen führt Anthropic auf der offiziellen RSP-Seite.
Die RSP funktioniert nach einem Wenn-dann-Prinzip. Anthropic definiert Fähigkeitsschwellen (Capability Thresholds), prüft jedes neue Modell vor der Freigabe gegen diese Schwellen und koppelt an jede überschrittene Schwelle ein Pflichtpaket an Schutzmaßnahmen. In der aktuellen Fassung 3.4 stehen vier Schwellen im Mittelpunkt. Zwei betreffen chemische und biologische Waffen, einmal Hilfe beim Nachbau bekannter Kampfstoffe, einmal die Entwicklung neuartiger Waffen (in Risk Reports und Modellkarten als CB-1 und CB-2 abgekürzt). Die dritte betrifft Sabotage durch fehlgeleitete KI-Systeme in kritischen Einsätzen, die vierte die automatisierte KI-Entwicklung. Letztere gilt als erreicht, wenn ein Modell Anthropics komplette Forscherbelegschaft zu höchstens dem Fünffachen der Kosten ersetzen könnte. Sie gilt ebenso als erreicht, wenn sich das Tempo des KI-Fortschritts gegenüber dem bisher schnellsten Verlauf ohne KI-Mithilfe verdoppelt, also zwei Jahre Fortschritt in einem Jahr, und das plausibel auf automatisierte Forschung zurückgeht.
Die AI Safety Levels beschreiben die Schutzpakete, die an diesen Schwellen hängen. ASL-1 steht in der Erstfassung für Systeme, die offensichtlich keine Katastrophe auslösen können. Eine Schach-KI etwa oder ein Sprachmodell von 2018. ASL-2 umfasst heutige Standardmodelle, die zwar gefährliches Wissen abrufen könnten, dies aber zu unzuverlässig tun, um einem Angreifer mehr zu nutzen als eine Suchmaschine. ASL-3 wurde in der Erstfassung fällig, sobald ein Modell das Risiko eines katastrophalen Missbrauchs gegenüber Suchmaschinen und Lehrbüchern deutlich erhöht oder erste eigenständige Handlungsfähigkeiten zeigt. Seit Version 2.0 lautet die Schwelle konkreter, nämlich „deutliche Hilfe für Personen mit naturwissenschaftlicher Grundbildung beim Beschaffen oder Einsetzen chemischer oder biologischer Waffen“. ASL-4 war von Anfang an nur als Skizze angelegt. Gedacht war die Stufe unter anderem für Modelle, deren Gewichte ein bösartiges KI-Entwicklungsprogramm massiv voranbringen würden, oder die sich selbst vervielfältigen und einer Abschaltung entziehen könnten. Seit Version 2.0 vom Oktober 2024 bezeichnet ASL keine Modellklasse mehr, sondern ausschließlich das Maßnahmenpaket. Ein Modell „ist“ also nicht ASL-3, es läuft unter ASL-3-Schutz.
Jedes Paket hat zwei Seiten. Der Deployment Standard soll den Missbrauch durch Nutzer verhindern, der Security Standard den Diebstahl der Modellgewichte. Was das konkret heißt, zeigte Anthropic am 22. Mai 2025, als es für Claude Opus 4 erstmals den ASL-3-Schutz aktivierte, laut Ankündigung zur ASL-3-Aktivierung „vorsorglich und vorläufig“, weil sich ein Biowaffen-Risiko nicht mehr sauber ausschließen ließ. Auf der Nutzerseite filtern seither sog. Constitutional Classifiers Ein- und Ausgaben in Echtzeit auf Waffenwissen, ergänzt um ein Prämienprogramm für gefundene Jailbreaks. Auf der Sicherheitsseite kamen über 100 Kontrollen hinzu, darunter das Vier-Augen-Prinzip für den Zugriff auf die Gewichte und vorläufige Bandbreitenlimits, die einen Abfluss der Modelldateien aus dem Rechenzentrum ausbremsen. Das Schwestermodell Claude Sonnet 4 blieb bei ASL-2. Laut dem Transparenz-Hub von Anthropic laufen Stand August 2026 alle Opus-Modelle seit Opus 4 und alle Sonnet-Modelle seit Sonnet 4.5 mindestens unter ASL-3-Schutz. Dasselbe gilt für Opus 5, Sonnet 5, Fable 5 und das nur für Partner zugängliche Mythos 5. Für die neuesten Modelle spricht Anthropic inzwischen von „CB-1-Fähigkeiten“ statt von ASL-3. Bei ASL-2 blieben Sonnet 4 und das kleine Haiku 4.5. Einen ausformulierten ASL-4-Standard gibt es bis heute nicht, und kein Modell läuft darunter.
Die größte Änderung seit 2023 betrifft die Pausen-Zusage. In der Erstfassung verpflichtete sich Anthropic, die Skalierung zu pausieren, wann immer die eigene Entwicklungsgeschwindigkeit die Fähigkeit übersteige, die Sicherheitsvorgaben der jeweiligen Stufe einzuhalten. Version 2.0 formulierte das als Zusage, kein Modell zu trainieren oder zu veröffentlichen, solange die nötigen Schutzmaßnahmen nicht stehen. Mit der Neufassung 3.0 vom 24. Februar 2026 entfiel diese bedingungslose Pausen-Zusage. Eine Verzögerung sagt Anthropic seitdem nur noch in zwei Fällen zu. Entweder hat es einen klaren Vorsprung vor allen Wettbewerbern, oder alle Wettbewerber mit vergleichbar starken Modellen haben nachweislich strenge Sicherheitsmaßnahmen, die Anthropic selbst noch nicht erreicht. Beides gilt erst für Modelle oberhalb der Schwelle zur automatisierten KI‑Forschung. Als Begründung führt die Richtlinie an, dass bei einer einseitigen Pause am Ende die Entwickler mit dem schwächsten Schutz das Tempo vorgäben. Das Magazin TIME sprach in seinem Bericht zur gestrichenen Pausen-Zusage vom Verzicht auf das „Flaggschiff-Versprechen“, Mitgründer Jared Kaplan erklärte dort, ein Trainingsstopp helfe niemandem.
An die Stelle der starren Stufen setzt Version 3 drei neue Bausteine. Risk Reports erscheinen alle drei bis sechs Monate und bewerten die Risiken aller öffentlich eingesetzten Modelle und ausdrücklich auch intern genutzter Modelle, sobald diese deutlich höhere Risiken bergen als bisher berichtete. Der erste erschien im Februar 2026, der zweite im August 2026; was im zweiten Bericht über das zurückgehaltene Modell steht, lesen Sie im Artikel zum Risk Report und Anthropic Model 2. Die Frontier Safety Roadmap nennt öffentliche Ziele für Sicherheit, Alignment und Schutzmaßnahmen, die Anthropic selbst als „keine harten Verpflichtungen“ bezeichnet. Und eine externe Prüfung wird Pflicht, sobald ein Bericht Modelle oberhalb der Forschungsschwelle abdeckt und stark geschwärzt ist, oder wenn der Long-Term Benefit Trust sie verlangt. Bisher griff keine dieser Pflichten. Den KI-Forschungs-Teil des Februar-Berichts ließ Anthropic dennoch freiwillig von METR prüfen, dessen Prüfbericht zum Risk Report das Ergebnis „sehr niedriges Risiko“ zwar teilt, die vorgelegten Belege dafür aber als unzureichend einstuft. Die Fassungen 3.1 bis 3.4 schärften danach primär die Schwellen nach, die für neuartige Kampfstoffe in 3.3, die für automatisierte Forschung in 3.1 und 3.4. Eine Transparenzregel wurde dabei gelockert, seit 3.4 müssen ungeschwärzte Risk Reports intern nur noch an mindestens 200 Mitarbeitende gehen statt an die gesamte Belegschaft mit normaler Freigabe.
Über die Einhaltung wacht ein Responsible Scaling Officer, seit Oktober 2024 Mitgründer Jared Kaplan, der Freigaben für Entwicklung und Veröffentlichung erteilt und anonyme Verstoßmeldungen entgegennimmt. Änderungen an der Richtlinie schlagen Geschäftsführung und RSO vor, der Verwaltungsrat beschließt sie in Abstimmung mit dem Long-Term Benefit Trust, einem unabhängigen Gremium, das seit Version 3.2 auch externe Prüfungen anordnen kann. An dieser Konstruktion setzt die Kritik an, denn das Unternehmen legt seine Regeln selbst fest, kann sie selbst ändern, und keine Behörde setzt sie durch. Der Thinktank GovAI hält Anthropic in seiner Analyse der RSP 3.0 vor, den Eindruck erweckt zu haben, die Pausen-Zusage sei bindend gewesen, wertet Risk Reports und Roadmap aber als echten Fortschritt. Das Future of Life Institute benotet Anthropic im AI Safety Index Sommer 2026 mit C+ (2,66 von 4,0) und damit vor OpenAI (C) und Google DeepMind (C). Zugleich merkt das Institut an, dass alle drei ebenso wie Meta ihre einseitigen Pausen-Zusagen abgeschwächt oder gestrichen haben.
Was 2023 freiwillig begann, wird inzwischen zur Pflicht. Kaliforniens Gesetz SB 53 verlangt seit dem 1. Januar 2026 von großen Anbietern ein veröffentlichtes „Frontier AI Framework“, in der EU müssen Anbieter von Modellen mit systemischem Risiko über den Verhaltenskodex zum EU AI Act ein vergleichbares „Safety and Security Framework“ vorlegen. Für SB 53 hat Anthropic im Dezember 2025 ein separates Frontier Compliance Framework veröffentlicht; die RSP bleibt daneben als freiwillige Richtlinie bestehen.
Einen direkten Einsatz im Betrieb hat die Responsible Scaling Policy nicht, sie regelt das Verhalten des Herstellers, nicht das des Nutzers. Ihr praktischer Nutzen liegt an drei anderen Stellen.
Erstens als Prüfmaßstab bei der Anbieterwahl. Wer für Angebotstexte, Kundenanfragen oder einen KI-Agenten im Büro zwischen Claude, ChatGPT und Gemini wählt, kann die Sicherheitsrahmenwerke der Anbieter nebeneinanderlegen. Dort steht nachlesbar, welche Risiken ein Anbieter vor der Freigabe prüft und wer im Unternehmen dafür geradesteht. Der AI Safety Index des Future of Life Institute fasst diesen Vergleich halbjährlich in Schulnoten zusammen und eignet sich als Einstieg, ohne dass man die Originaldokumente lesen muss.
Zweitens erklärt die RSP ein Verhalten, das Nutzern im Alltag begegnen kann. Die ASL-3-Filter blockieren eine eng gefasste Klasse von Anfragen rund um chemische und biologische Waffen, und Anthropic räumt selbst ein, dass sie Fehlalarme erzeugen. Wie weit das reichen kann, zeigte Fable 5, dessen Filter zunächst fast jede Biologie-Frage abwies; wie Anthropic die Fehlalarme danach drückte, beschreibt der Artikel zum Biologie-Filter von Fable 5. Nicht jede Ablehnung geht auf die RSP zurück. Bei biologischen und chemischen Fachfragen, etwa aus Labor, Schädlingsbekämpfung oder Agrarbetrieb, ist sie aber oft eine Schutzmaßnahme aus der Richtlinie und keine Störung.
Drittens liefert die Wenn-dann-Logik eine brauchbare Vorlage für eigene Regeln im KI-Einsatz, auch ohne Katastrophenrisiko. Ein Betrieb, der einen KI-Agenten Termine buchen oder Rechnungen vorbereiten lässt, legt analog fest, ab welcher Schwelle ein Mensch freigeben muss. Typische Schwellen sind Aufträge über einem bestimmten Betrag, Stornierungen oder der Erstkontakt mit Neukunden. Was Anthropic mit Fähigkeitsschwellen und Schutzpaketen für Spitzenmodelle macht, ist im Kleinen nichts anderes als eine schriftliche Eskalationsregel, die vor dem ersten Fehler existiert und nicht erst danach.