Glossareintrag

Was bedeutet
Context Rot bei KI/AI (Kontext-Verfall)?

Veröffentlicht: 30/08/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Context Rot bei KI/AI (Kontext-Verfall)

Definition:

Context Rot (deutsch Kontext-Verfall) ist der messbare Qualitätsverlust großer LLMs bei wachsender Eingabelänge. Je mehr Text ein Modell in einer Anfrage oder einem Gesprächsverlauf verarbeiten muss, umso unzuverlässiger findet und nutzt es die enthaltenen Informationen. Lange, bevor das Kontextfenster des Modells rechnerisch voll ist, setzt der Verfall ein. Context Rot ist deshalb kein Speicherüberlauf. Es ist ein schleichender Aufmerksamkeitsverlust in seiner Bearbeitung und dem länger werdenden Verlauf.

Die Context-Rot-Studie der Datenbankfirma Chroma wies den Effekt im Juli 2025 an 18 Sprachmodellen von OpenAI, Anthropic, Google und Alibaba nach. Alle 18 verloren mit steigender Eingabemenge an Genauigkeit. Auch bei sehr einfachen Aufgaben.

Eine Hacker-News-Diskussion hat den Begriff im Juni 2025 populär gemacht. Der britische Entwickler Simon Willison übernahm die Wortschöpfung noch am selben Tag in sein Fachblog. Die Chroma-Studie lieferte anschließend die Messdaten.

Beschreibung:

Die Chroma-Studie vom Juli 2025 hat Context Rot systematisch vermessen. Das Team um Kelly Hong testete 18 Modelle, darunter Claude Opus 4, GPT-4.1, o3, Gemini 2.5 Pro und Qwen3, mit insgesamt 194.480 Modellaufrufen. Vier Befunde stechen heraus:

  • Länge allein senkt die Qualität. Im Test LongMemEval beantworteten die Modelle Fragen zu einem Chatverlauf deutlich besser, wenn sie statt des vollen Verlaufs mit rund 113.000 Token nur einen passenden Auszug von etwa 300 Token erhielten.
  • Ablenkung verschärft den Abfall. Schon ein einziger ähnlich klingender, aber falscher Textbaustein (Distraktor) drückte die Trefferquote, vier solcher Bausteine verstärkten den Effekt weiter.
  • Sogar Trivialaufgaben brechen ein. Beim schlichten Wiederholen einer Wortliste sank die Zuverlässigkeit mit wachsender Länge. Einzelne Modelle verweigerten die Aufgabe in manchen Durchläufen sogar komplett.
  • Struktur hilft nicht automatisch. Überraschenderweise fanden die Modelle eine gesuchte Information in wahllos durchmischten Textschnipseln besser als im logisch aufgebauten Originaldokument.

Schon 2023 wies die Studie „Lost in the Middle“ eines Teams um die Stanford University nach, dass relevante Angaben in der Mitte einer langen Eingabe deutlich häufiger übersehen werden als an deren Anfang oder Ende.

Anthropic nennt als Grund in seinem Engineering-Leitfaden für KI-Agenten ein begrenztes „Aufmerksamkeits-Budget“. Die Transformer-Architektur setzt beim Antworten jedes Token mit jedem anderen in Beziehung. Je länger die Eingabe, desto dünner verteilt sich diese Aufmerksamkeit, und desto eher übersieht das Modell einzelne Details. Anthropic nennt den Kontext deshalb eine endliche Ressource mit abnehmendem Grenznutzen.

Die wachsenden Kontextfenster (auch Token-Window) der Anbieter lösen nicht das Problem. Claude und Gemini nehmen heute rund eine Million Token pro Anfrage an, GPT-5.2 rund 400.000, Metas Llama 4 Scout nominell zehn Millionen. Die Messungen zeigen Qualitätsverluste, aber weit unterhalb dieser Grenzen. Google gesteht in seiner Entwickler-Dokumentation zu langen Kontexten ein, dass die Leistung je nach Inhalt sehr schwankend ist. Unnötige Token sollen vermieden werden.

Eine Studie zu Context Rot bei Überwachungsmodellen vom Mai 2026 zeigte, dass KI-Kontrollmodelle riskante Aktionen zwei- bis dreißigmal häufiger übersehen, wenn diese erst nach 800.000 Token unauffälligen Materials auftauchen. Eine Untersuchung zu kritischen Kontextlängen-Schwellen vom Januar 2026 beschreibt außerdem, dass die Leistung mancher Modelle ab einer bestimmten Länge abrupt einbricht und nicht schleichend.

Context Rot bei KI/AI (Kontext-Verfall) für Unternehmen und Handwerker:

Context Rot erklärt, warum ein KI-Chat, der über Wochen einfach weitergeführt wird, schlechtere Ergebnisse liefert. Wer in einem einzigen Dauer-Chat erst ein Angebot für Kunde A formuliert, dann eine Reklamation von Kunde B beantwortet und zwischendurch Social-Media-Texte schreiben lässt, füllt das Kontextfenster mit Altlasten. Das Modell mischt dann Kundendaten, ignoriert früh vereinbarte Vorgaben oder fällt in generische Formulierungen zurück. Es wird nicht „dümmer“, sondern arbeitet gegen einen immer längeren Verlauf an.

Das schützt Unternehmen vor dem Effekt:

  • Pro Vorgang ein neuer Chat. Jedes Angebot, jede Reklamation und jeder Werbetext bekommen eine frische Unterhaltung. Anthropic selbst empfiehlt in seiner Hilfe zu Längen-Limits, lange Unterhaltungen neu zu starten.
  • Nur relevante Auszüge mitgeben. Statt der kompletten 80-Seiten-Ausschreibung samt alter Angebote und Preislisten nur die Abschnitte hochladen, um die es gerade geht.
  • Zwischenstand zusammenfassen lassen. Bei langen Projekten den Chat um eine kurze Zusammenfassung bitten. Mit dieser dann eine neue Unterhaltung beginnen. Entwickler-Werkzeuge wie Claude Code erledigen diese Kompaktierung automatisch, sobald der Verlauf zu lang wird, oder auf den Befehl „/compact“.
  • Wichtiges an Anfang oder Ende stellen. Zentrale Anweisungen und Tatsachen gehören an den Beginn oder den Schluss der Eingabe, nicht in die Mitte eines langen Dokuments.

Bei KI-Tools mit Firmenwissen sollte man darauf achten, wie das Entwicklerstudio mit Context Rot umgeht. Professionelle Lösungen packen nicht das gesamte Wissen in jede Anfrage, sondern holen per RAG nur die passenden Bausteine. Andere halten den Verlauf per Context Engineering schlank oder verteilen Aufgaben auf mehrere KI-Agenten. Diese melden dann nur noch ihre Ergebnisse zurück. Ein Modell mit großem Kontextfenster heißt also nicht automatisch, dass es besser ist.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?