Glossareintrag
Wir denken. KI tippt mit.
Das Kontextfenster (englisch Context Window) ist die maximale Textmenge, die ein KI-Sprachmodell beim Beantworten einer Anfrage gleichzeitig im Blick behalten kann, gemessen in Tokens. Es funktioniert wie das Arbeitsgedächtnis eines großen Sprachmodells. Was im Fenster steht, kann die KI nutzen. Was herausgefallen oder nie hineingelangt ist, existiert für sie in diesem Moment nicht.
In das Fenster zählt weit mehr als die aktuelle Frage. Auch der komplette bisherige Gesprächsverlauf, hochgeladene Dokumente, die unsichtbaren Systemanweisungen des Anbieters und die entstehende Antwort selbst belegen Platz. Die Spitzenmodelle von Anthropic, OpenAI und Google fassen beim API-Zugang inzwischen rund 1 Million Tokens, das entspricht gut einer halben Million englischer Wörter. In den Chat-Abos für Endkunden ist das Fenster meist deutlich kleiner.
Wie groß das Kontextfenster ist, hängt vom Modell und vom Zugangsweg ab, und die Unterschiede sind erheblich. Die Chat-Apps für Endkunden bieten oft nur einen Bruchteil dessen, was dieselben Modelle über die Programmierschnittstelle (API) verarbeiten. Stand September 2026 nennen die Anbieter diese Werte:
1 Million Tokens entsprechen laut Anthropic rund 555.000 englischen Wörtern, also mehreren dicken Romanen auf einmal. Deutsche Texte verbrauchen wegen langer zusammengesetzter Wörter mehr Tokens pro Wort, in dasselbe Fenster passt also spürbar weniger deutscher Text. Wie ein Satz in Tokens zerfällt und wie viele es werden, zeigt der interaktive Tokenizer von OpenAI live zum Ausprobieren, auch mit deutschem Text.
Ist das Fenster voll, beginnt die KI zu vergessen. Chat-Anwendungen entfernen dann still die ältesten Gesprächsteile, das Modell verliert also zuerst den Gesprächsanfang. Manche Dienste fassen ältere Passagen stattdessen automatisch zusammen, um Platz zu schaffen. Beim API-Zugang bricht eine zu lange Anfrage schlicht mit einer Fehlermeldung ab.
Ein großes Fenster garantiert dabei kein gutes Gedächtnis. Die Studie „Lost in the Middle" von Forschern um die Stanford University (2023) zeigte, dass Sprachmodelle Informationen am Anfang und am Ende des Kontexts deutlich zuverlässiger finden als in der Mitte. Die Datenbankfirma Chroma wies 2025 in ihrer Context-Rot-Studie an 18 Sprachmodellen nach, dass die Leistung mit wachsender Kontextlänge selbst bei einfachen Aufgaben sinkt. Dieser Effekt trägt den Namen Context Rot. Anthropic räumt diesen Effekt in der eigenen Dokumentation zum Kontextfenster offen ein.
Auch die Kosten hängen direkt am Kontextfenster. Bei jeder neuen Nachricht verarbeitet das Modell den gesamten bisherigen Verlauf erneut, lange Gespräche werden dadurch langsamer, teurer und verbrauchen die Nutzungslimits der Abos schneller. Beim API-Zugang verlangen manche Anbieter für sehr lange Eingaben Aufschläge. OpenAI berechnet bei GPT-6 Astra wie schon bei GPT-5.6 Sol oberhalb von 272.000 Eingabe-Tokens den doppelten Eingabepreis und das 1,5-Fache für die Ausgabe. Google verdoppelt bei Gemini 3.1 Pro laut der offiziellen Preisliste der Gemini-API die Preise oberhalb von 200.000 Tokens, während Anthropic den 1-Million-Kontext ohne Aufschlag zum normalen Tokenpreis abrechnet.
ChatGPT startete Ende 2022 mit einem Fenster von rund 4.000 Tokens, im Mai 2023 erreichte Claude als erster großer Anbieter 100.000 Tokens, Anfang 2024 durchbrach Gemini 1.5 Pro die Marke von 1 Million. Im Jahr 2026 ist die Million bei den Top-Modellen aller drei großen Anbieter der Normalfall.
Das Kontextfenster ist außerdem nicht dasselbe wie das Wissen des Modells. Was die KI aus ihren Trainingsdaten gelernt hat, steht ihr immer zur Verfügung und belegt keinen Platz im Fenster. Gedächtnis-Funktionen wie ChatGPT Memory oder die Projekte in Claude speichern Fakten dauerhaft außerhalb des Fensters und laden sie bei Bedarf hinein, sie vergrößern das Fenster selbst aber nicht. Und Techniken wie RAG holen aus großen Dokumentbeständen nur die relevanten Ausschnitte in den Kontext, statt alles auf einmal hineinzuladen.
Für Betriebe entscheidet das Kontextfenster darüber, welche Unterlagen die KI in einem Rutsch verarbeiten kann. Ein 100-seitiges Leistungsverzeichnis oder ein langer Bauvertrag kommt grob auf 60.000 bis 80.000 Tokens. Im kostenlosen ChatGPT scheitert so ein Dokument am 27.000er-Fenster, im Plus-Abo verarbeitet das Reasoning-Modell mit 256.000 Tokens die komplette Datei, und Claude oder Gemini schlucken über die API auch das Zehnfache. Wer regelmäßig dicke PDFs analysieren lässt, etwa Ausschreibungen, Wartungsverträge oder Herstellerdokumentationen, sollte die Abo-Stufe deshalb nach dem Fenster auswählen, nicht nur nach dem Preis. Einen ausführlichen Vergleich der Abos samt Limits bietet unser Artikel Claude vs ChatGPT 2026 mit Preisen, Kontextfenstern und Nutzungslimits.
Viele Nutzer führen einen einzigen Dauer-Chat für alles, vom Angebotstext bis zur Reklamation. Genau dort schlägt das volle Fenster zu. Die KI vergisst Absprachen vom Gesprächsanfang, die Antworten werden unschärfer und das Nutzungskontingent schmilzt schneller, weil jede Nachricht den ganzen Verlauf erneut mitschickt.
Drei Faustregeln helfen im Alltag:
Bei langen Projekten lassen Sie sich am Ende einer Sitzung eine kurze Zusammenfassung des Stands geben und fügen diese als Startnachricht in den nächsten Chat ein. So bleibt das Wesentliche erhalten, ohne dass der alte Verlauf das Fenster füllt. Das gezielte Zusammenstellen dessen, was im Fenster landet, heißt Context Engineering.