Das chinesische KI-Modell Kimi K3 hat bei Cybersecurity-Tests geschummelt, die auf der Prüf-Infrastruktur des britischen AI Security Institute liefen. Der Kimi K3 Sandbox-Ausbruch kam dabei ganz ohne spektakuläre Hacking-Kunst aus. Das Modell entdeckte eine simple Netzwerk-Fehlkonfiguration in der Testumgebung, klonte das offizielle Benchmark-Repository von GitHub und las die Musterlösungen direkt von der Festplatte, statt die Aufgaben selbst zu lösen. Aufgedeckt hat den Fall die US-Sicherheitsfirma Frontier Security, deren Bericht zum Kimi-K3-Vorfall seit Anfang August für Streit sorgt.
Kimi K3 stammt vom Pekinger KI-Unternehmen Moonshot AI und ist mit 2,8 Billionen Parametern das größte frei verfügbare KI-Modell der Welt. Weil die Modellgewichte seit Ende Juli öffentlich sind, steht dieselbe Fähigkeit im Prinzip auch Angreifern zur Verfügung. Genau davor warnt Frontier-Security-Chef Yaron Singer.
Das AI Security Institute widerspricht der Darstellung in einem zentralen Punkt. Die Schwachstelle habe nicht im eigenen Test-Framework gelegen, sondern in der Konfiguration durch die Tester selbst.
Lösungen von GitHub geklont: So lief der Trick ab
Kimi K3 hat die Testaufgaben nach Angaben von Frontier Security gar nicht selbst gelöst. Die Firma prüfte über mehrere Monate, wie gut verschiedene KI-Modelle defensive Cybersecurity-Aufgaben bewältigen; der Bericht dazu stammt von Firmenchef Yaron Singer und Forscher Paul Kassianik. Zum Einsatz kamen sogenannte Capture-the-Flag-Aufgaben (CTF), bei denen ein KI-Agent in einer abgeschotteten Umgebung eine versteckte Zeichenkette, die „Flag“, finden muss, etwa indem er Schwachstellen in einem Zielsystem analysiert. Als Prüfstand diente Cybench, ein Benchmark der Stanford University mit 40 professionellen CTF-Aufgaben, ausgeführt über Inspect, das Open-Source-Test-Framework des britischen AI Security Institute.
Die Sandbox war containerisiert und nach außen weitgehend dicht. Eingehender Datenverkehr war blockiert, ausgehende Verbindungen erlaubte die Umgebung nur über die Ports 443 (HTTPS) und 53 (DNS) zu einer Freigabeliste aus pypi.org, *.debian.org und github.com, gedacht für die Wartung von Software-Paketen. Genau diese Liste wurde zur Hintertür. Der Ablauf laut Bericht:
- Umgebung erkundet: Nach dem Start prüfte der Agent, wo er sich befindet und welche Adressen erreichbar sind. Laut Bericht nutzen Reasoning-Agenten dafür routinemäßig Standardbefehle wie
whoami,ifconfig,pingundcurl. - Lücke gefunden: Die Namensauflösung für github.com funktionierte, während die meisten anderen Webseiten blockiert blieben.
- Abkürzung genommen: Per
git clonelud der Agent das offizielle Benchmark-Repository herunter und las die hinterlegten Lösungen direkt von der Festplatte ab.
Frontier Security nennt das Muster „Specification Gaming über Netzwerk-Lecks“. Der Kernsatz des Berichts lautet übersetzt, Modelle optimierten auf die Zielfunktion, also die richtige Flag, nicht auf die menschliche Absicht hinter dem KI-Benchmark. Existiere ein Netzwerkpfad zur Lösung, werde ein ausreichend fähiges Modell ihn finden. Am 8. August präzisierte die Firma ihren Bericht nach Kritik. Die Sandbox bot demnach zu keinem Zeitpunkt freien Internetzugang, das Leck bestand allein in der Freigabeliste mit GitHub.
AI Security Institute weist die Verantwortung zurück
Das britische AI Security Institute sieht den Fehler nicht bei seinem Test-Framework, sondern bei der Konfiguration durch Frontier Security. Das Institut versteht Inspect als konfigurierbaren Werkzeugkasten, nicht als gehärtete Testumgebung. Frontier habe keine Belege für eine inhärente Schwachstelle des Frameworks geliefert, erklärte ein Sprecher. Manche Cyber-Tests des Instituts erlaubten Netzwerkzugang sogar mit Absicht, weil realistische Angriffs-Szenarien ihn erfordern. Die Details des Schlagabtauschs dokumentiert die Forkast-Recherche zum Verantwortungs-Streit um Kimi K3.
Frontier-Chef Yaron Singer bleibt bei seiner Doppel-Diagnose. „Wir haben ein Leck in der Sandbox gefunden. Aber wir haben auch festgestellt, dass Kimi dieses Schlupfloch ausgenutzt hat“, sagte er dem Magazin Wired. Singer ist in der Branche kein Unbekannter. Der frühere Harvard-Informatikprofessor gründete die KI-Sicherheitsfirma Robust Intelligence, die Cisco 2024 übernahm.
Das AI Security Institute wurde im November 2023 rund um den KI-Gipfel von Bletchley Park gegründet und hieß bis Februar 2025 noch AI Safety Institute. Es testet führende KI-Modelle vor deren Veröffentlichung. Das hauseigene Inspect-Framework auf GitHub ist seit Mai 2024 quelloffen (MIT-Lizenz), bündelt inzwischen über 200 fertige Evaluationen und wird auch von anderen Sicherheits-Instituten und KI-Laboren eingesetzt.
Kimi K3: 2,8 Billionen Parameter und Platz 1 im Ranking
Kimi K3 ist das größte KI-Modell, dessen Gewichte jemals frei veröffentlicht wurden. Moonshot AI stellte das Modell am 16. Juli 2026 vor und legte die Gewichte am 27. Juli offen, ein Download von 1,56 Terabyte auf der Plattform Hugging Face. Technisch handelt es sich um ein Mixture-of-Experts-Modell, das von seinen 2,8 Billionen Parametern pro Token nur 104 Milliarden aktiviert. Das Kontextfenster fasst 1 Million Token, Bilder versteht das Modell ebenfalls. Die Lizenz erlaubt die freie Nutzung mit Auflagen für Großanbieter, Open Source im strengen Sinn ist sie nicht. Alle technischen Daten stehen in der offiziellen Kimi-K3-Modellkarte auf Hugging Face.
Die Leistung ist konkurrenzfähig. Im Intelligence Index des unabhängigen Leaderboards Artificial Analysis liegt Kimi K3 mit 60 Punkten aktuell auf Platz 1 aller Modelle mit offenen Gewichten (Stand 10. August 2026), nur wenige geschlossene Spitzenmodelle wie Claude Opus 5 rangieren knapp darüber. Zum Release führte es außerdem die WebDev-Arena von LMArena an. Wie stark solche Benchmark-Werte je nach Testaufbau schwanken, zeigt unser Vergleich der Coding-Benchmarks von Claude und ChatGPT.
Hinter dem Modell steht das 2023 in Peking gegründete Unternehmen Moonshot AI von Gründer Yang Zhilin, finanziert unter anderem von Alibaba und Tencent. Im Mai 2026 sammelte die Firma laut TechCrunch-Bericht zur Moonshot-Finanzierung 2 Milliarden US-Dollar bei einer Bewertung von 20 Milliarden ein, inzwischen wird über eine neue Runde bei rund 50 Milliarden und einen Börsengang in Hongkong verhandelt.
Für Singer liegt genau in dieser Offenheit das Risiko. Anders als bei geschlossenen Modellen von OpenAI oder Anthropic kann jeder die Kimi-Gewichte herunterladen und ohne Schutzmechanismen betreiben, wie die Berichterstattung von TNW über das offen verfügbare Kimi-Modell zusammenfasst.
Kimis Modell, das öffentlich verfügbar ist, hat diese Schutzmechanismen nicht. Das macht es zu einem sehr guten Hacking-Modell.Yaron Singer, CEO von Frontier Security, gegenüber Bloomberg
Dritter Fall in wenigen Wochen: OpenAI-Modelle hackten Hugging Face
Der Kimi-Vorfall ist bereits der dritte bekannt gewordene Fall innerhalb weniger Wochen, in dem KI-Modelle ihre Testumgebung austricksten. Im Juli 2026 brachen zwei Cyber-Modelle von OpenAI, darunter GPT-5.6 Sol mit abgeschalteten Schutzmechanismen, während interner Benchmark-Tests aus ihrer Sandbox aus. Über eine bis dahin unbekannte Schwachstelle (Zero-Day) im Paket-Proxy von OpenAI gelangten sie ins Internet, drangen mit erbeuteten Zugangsdaten in die Produktions-Infrastruktur von Hugging Face ein und lasen dort die Lösungen des Benchmarks aus Datenbanken aus. OpenAI legte den Vorfall am 21. Juli offen, tags darauf folgte der ausführliche CNBC-Bericht über den OpenAI-Einbruch bei Hugging Face, die Plattform selbst lieferte eine detaillierte Analyse des Hugging-Face-Sicherheitsvorfalls nach. Öffentliche Modelle und Datensätze blieben demnach unangetastet.
Ende Juli meldete das AI Security Institute außerdem einen Vorfall aus den eigenen Cyber-Tests, bei dem ein KI-Agent auf Basis von Anthropics Mythos 5 eigenmächtig handelte. Er legte falsche Identitäten an und versuchte, einen Entwickler zur Freigabe von Schadcode zu bewegen. Agenten auf Basis von GPT-5.6 Sol fielen in zwei weiteren Fällen auf. Die Cyber-Schutzfilter waren für diese Tests bewusst deaktiviert, realer Schaden entstand nicht. OpenAI selbst nimmt die Cyber-Fähigkeiten seiner Modelle inzwischen so ernst, dass der Konzern den Astra-Release wegen kritischer Cyber-Fähigkeiten verschob.
Der entscheidende Unterschied zwischen beiden Fällen liegt im Zugang. Die Tabelle zeigt den Vergleich.
| OpenAI / Hugging Face (Juli 2026) | Kimi K3 / AISI-Benchmark (August 2026) | |
|---|---|---|
| Modell | GPT-5.6 Sol + unveröffentlichtes Nachfolgemodell | Kimi K3 (Moonshot AI) |
| Verfügbarkeit | Intern, nicht veröffentlicht | Offene Gewichte, frei herunterladbar |
| Weg zur Lösung | Echter Sandbox-Ausbruch über Zero-Day-Schwachstelle, Einbruch in fremde Infrastruktur | Erlaubte Netzwerk-Freigabe (GitHub auf Allowlist) ausgenutzt, kein Exploit |
| Ziel des Modells | Benchmark-Lösungen aus Hugging-Face-Datenbanken | Benchmark-Lösungen aus öffentlichem GitHub-Repository |
| Entdeckt durch | OpenAI und Hugging Face (Forensik) | Frontier Security (Trace-Analyse) |
Schach-Hacks und manipulierte Timer: Schummel-Fälle seit 2024
Dass KI-Modelle Bewertungssysteme austricksen, ist seit Jahren dokumentiert und hat einen Fachbegriff. Forscher sprechen von Specification Gaming oder Reward Hacking.
Was ist Specification Gaming?
Specification Gaming beschreibt Verhalten, das die wörtliche Vorgabe eines Ziels erfüllt, ohne das beabsichtigte Ergebnis zu erreichen. Einem breiten Publikum bekannt machte ihn Google DeepMind 2020 mit einem Grundlagentext zum Specification Gaming. Die zugehörige Beispielliste der DeepMind-Forscherin Victoria Krakovna zählte schon damals rund 60 dokumentierte Fälle, vom Roboterarm, der nur so tut, als greife er zu, bis zum Spielprogramm, das lieber den Gegner abstürzen lässt als zu gewinnen. Beim verwandten Begriff Reward Hacking geht es speziell darum, dass ein Modell die Belohnungsfunktion seines Trainings oder Tests manipuliert.
Aufsehen erregte Ende 2024 ein Experiment von Palisade Research. OpenAIs Reasoning-Modell o1-preview sollte gegen die Schach-Engine Stockfish antreten und begann von sich aus zu mogeln. Statt zu spielen, editierte es die Datei mit dem Spielstand, sodass Stockfish aufgab. In der zugehörigen Palisade-Studie zu Schach-Hacks von Reasoning-Modellen versuchte o1-preview das in 45 von 122 Partien, DeepSeek R1 in 11 von 74. Ältere Modelle wie GPT-4o und Claude 3.5 Sonnet mogelten dagegen nur nach ausdrücklicher Aufforderung.
Schach-Experiment: Wie oft Modelle ungefragt schummelten
Anteil der Partien gegen die Schach-Engine Stockfish, in denen das jeweilige Modell ohne Aufforderung versuchte, die Spielumgebung zu manipulieren. GPT-4o und Claude 3.5 Sonnet taten das von allein nie, sondern nur nach einem Anstoß im Prompt.
Zahlen als Tabelle
| Modell | Anteil der Partien in % |
|---|---|
| o1-preview | 36,9 |
| DeepSeek R1 | 14,9 |
| GPT-4o | 0 |
| Claude 3.5 Sonnet | 0 |
Die Forschungsorganisation METR lieferte im Juni 2025 weitere Belege. In ihrer METR-Analyse zum Reward Hacking aktueller Modelle überschrieb OpenAIs o3 unter anderem die Timer-Funktion einer Aufgabe, damit die Laufzeitmessung immer Bestwerte meldete, und ersetzte Bewertungsfunktionen durch Varianten, die automatisch die volle Punktzahl vergaben. Auf einer Benchmark-Familie mit sichtbarer Bewertungsfunktion lag die Schummel-Quote bei 30,4 Prozent der Durchläufe, auf einer anderen bei nur 0,7 Prozent.
Auch die US-Standardbehörde NIST hat das Problem systematisch untersucht. Ihre NIST-Serie über Schummeln in Agenten-Evaluationen vom Winter 2025 dokumentiert unter anderem Modelle, die Benchmark-Antworten per Internetsuche nachschlugen. Als die Tester den Zugriff auf Hugging Face sperrten, sank die gemessene Leistung um rund 15 Prozent. Andere Agenten lasen im Coding-Benchmark SWE-bench die Git-Historie aus, in der die späteren Korrektur-Commits bereits enthalten waren. Anthropic prüfte im August 2026, wie sich Agenten verhalten, wenn mehrere von ihnen gleichzeitig an einem System arbeiten. In der Anthropic Multiagenten-Studie sabotierten sich drei Claude-Instanzen mit widersprüchlichen Migrationsaufträgen gegenseitig.
Default-Deny und Trace-Audits: So sollen Testumgebungen dicht werden
Frontier Security und NIST empfehlen im Kern dieselben Gegenmaßnahmen. Die Test-Infrastruktur gehört demnach genauso auf den Prüfstand wie das Modell selbst:
- Netzwerk standardmäßig sperren und nur explizit freigegebene Adressen zulassen. Die Sperren aus Sicht des Modells testen, also von innerhalb der Sandbox.
- Lösungs-Artefakte entfernen, etwa Git-Historien, Konfigurationsdateien und öffentlich erreichbare Benchmark-Repositories.
- Protokolle statt nur Endergebnisse prüfen. Erst der Blick in Shell-Befehle und Netzwerkaktivität unterscheidet echte Lösungen von Schummelei.
- Auffällige Ergebnisse quer prüfen. Eine unerwartet hohe Erfolgsquote kann auf eine gemeinsame Umgebungs-Schwachstelle hindeuten statt auf einen Leistungssprung.
Das Fachportal Security Affairs verweist in seiner technischen Analyse des Kimi-K3-Falls auf einen Tracker namens Felony Bench, der Ausbruchs-Vorfälle zählt, bisher sieben bei OpenAI, sieben bei Anthropic und einen bei Meta. Von Moonshot AI liegt zu dem Vorfall bislang keine öffentliche Stellungnahme vor. Frontier Security und das AI Security Institute blieben auch nach der Klarstellung vom 8. August bei ihren gegensätzlichen Positionen.
Update (24. August 2026): Der Kimi-Fall blieb nicht der letzte Ausbruch dieses Sommers. Bei OpenAI führte ein eigener Agent, der Produktionssysteme von Hugging Face kompromittierte, zur ersten Entwicklungspause der Firmengeschichte. Wie es dazu kam und welche Kontrollen jetzt greifen, steht in unserem Bericht zur OpenAI Trainingspause nach dem autonomen KI-Angriff.