Glossareintrag

Was bedeutet
Kontextfenster bei AI/KI (Context Window)?

Veröffentlicht: 16/08/2026
Aktualisiert: 04/09/2026

Wir denken. KI tippt mit.

Kontextfenster bei AI/KI (Context Window)

Definition:

Das Kontextfenster (englisch Context Window) ist die maximale Textmenge, die ein KI-Sprachmodell beim Beantworten einer Anfrage gleichzeitig im Blick behalten kann, gemessen in Tokens. Es funktioniert wie das Arbeitsgedächtnis eines großen Sprachmodells. Was im Fenster steht, kann die KI nutzen. Was herausgefallen oder nie hineingelangt ist, existiert für sie in diesem Moment nicht.

In das Fenster zählt weit mehr als die aktuelle Frage. Auch der komplette bisherige Gesprächsverlauf, hochgeladene Dokumente, die unsichtbaren Systemanweisungen des Anbieters und die entstehende Antwort selbst belegen Platz. Die Spitzenmodelle von Anthropic, OpenAI und Google fassen beim API-Zugang inzwischen rund 1 Million Tokens, das entspricht gut einer halben Million englischer Wörter. In den Chat-Abos für Endkunden ist das Fenster meist deutlich kleiner.

Beschreibung:

Wie groß das Kontextfenster ist, hängt vom Modell und vom Zugangsweg ab, und die Unterschiede sind erheblich. Die Chat-Apps für Endkunden bieten oft nur einen Bruchteil dessen, was dieselben Modelle über die Programmierschnittstelle (API) verarbeiten. Stand September 2026 nennen die Anbieter diese Werte:

  • Claude (Anthropic): 1 Million Tokens für die aktuellen Modelle Fable 5, Opus 5 und Sonnet 5 über die API. Das kleinere Haiku 4.5 liegt bei 200.000 Tokens.
  • ChatGPT (OpenAI): Das API-Spitzenmodell GPT-6 Astra fasst 1.050.000 Tokens, von denen höchstens 128.000 auf die Ausgabe entfallen. Ebenso viel fasst das ältere GPT-5.6 Sol. Im ChatGPT-Abo ist das Fenster laut der offiziellen ChatGPT-Preisübersicht deutlich kleiner. Das Schnellmodell arbeitet mit 27.000 Tokens (Free), 54.000 (Go und Plus) oder 128.000 (Pro), die Reasoning-Modelle mit 256.000 Tokens und im Pro-Abo mit 400.000.
  • Gemini (Google): 1 Million Tokens Eingabe bei Gemini 3.1 Pro und Gemini 3 Flash.

1 Million Tokens entsprechen laut Anthropic rund 555.000 englischen Wörtern, also mehreren dicken Romanen auf einmal. Deutsche Texte verbrauchen wegen langer zusammengesetzter Wörter mehr Tokens pro Wort, in dasselbe Fenster passt also spürbar weniger deutscher Text. Wie ein Satz in Tokens zerfällt und wie viele es werden, zeigt der interaktive Tokenizer von OpenAI live zum Ausprobieren, auch mit deutschem Text.

Ist das Fenster voll, beginnt die KI zu vergessen. Chat-Anwendungen entfernen dann still die ältesten Gesprächsteile, das Modell verliert also zuerst den Gesprächsanfang. Manche Dienste fassen ältere Passagen stattdessen automatisch zusammen, um Platz zu schaffen. Beim API-Zugang bricht eine zu lange Anfrage schlicht mit einer Fehlermeldung ab.

Ein großes Fenster garantiert dabei kein gutes Gedächtnis. Die Studie „Lost in the Middle" von Forschern um die Stanford University (2023) zeigte, dass Sprachmodelle Informationen am Anfang und am Ende des Kontexts deutlich zuverlässiger finden als in der Mitte. Die Datenbankfirma Chroma wies 2025 in ihrer Context-Rot-Studie an 18 Sprachmodellen nach, dass die Leistung mit wachsender Kontextlänge selbst bei einfachen Aufgaben sinkt. Dieser Effekt trägt den Namen Context Rot. Anthropic räumt diesen Effekt in der eigenen Dokumentation zum Kontextfenster offen ein.

Auch die Kosten hängen direkt am Kontextfenster. Bei jeder neuen Nachricht verarbeitet das Modell den gesamten bisherigen Verlauf erneut, lange Gespräche werden dadurch langsamer, teurer und verbrauchen die Nutzungslimits der Abos schneller. Beim API-Zugang verlangen manche Anbieter für sehr lange Eingaben Aufschläge. OpenAI berechnet bei GPT-6 Astra wie schon bei GPT-5.6 Sol oberhalb von 272.000 Eingabe-Tokens den doppelten Eingabepreis und das 1,5-Fache für die Ausgabe. Google verdoppelt bei Gemini 3.1 Pro laut der offiziellen Preisliste der Gemini-API die Preise oberhalb von 200.000 Tokens, während Anthropic den 1-Million-Kontext ohne Aufschlag zum normalen Tokenpreis abrechnet.

ChatGPT startete Ende 2022 mit einem Fenster von rund 4.000 Tokens, im Mai 2023 erreichte Claude als erster großer Anbieter 100.000 Tokens, Anfang 2024 durchbrach Gemini 1.5 Pro die Marke von 1 Million. Im Jahr 2026 ist die Million bei den Top-Modellen aller drei großen Anbieter der Normalfall.

Das Kontextfenster ist außerdem nicht dasselbe wie das Wissen des Modells. Was die KI aus ihren Trainingsdaten gelernt hat, steht ihr immer zur Verfügung und belegt keinen Platz im Fenster. Gedächtnis-Funktionen wie ChatGPT Memory oder die Projekte in Claude speichern Fakten dauerhaft außerhalb des Fensters und laden sie bei Bedarf hinein, sie vergrößern das Fenster selbst aber nicht. Und Techniken wie RAG holen aus großen Dokumentbeständen nur die relevanten Ausschnitte in den Kontext, statt alles auf einmal hineinzuladen.

Kontextfenster bei AI/KI (Context Window) für Unternehmen und Handwerker:

Für Betriebe entscheidet das Kontextfenster darüber, welche Unterlagen die KI in einem Rutsch verarbeiten kann. Ein 100-seitiges Leistungsverzeichnis oder ein langer Bauvertrag kommt grob auf 60.000 bis 80.000 Tokens. Im kostenlosen ChatGPT scheitert so ein Dokument am 27.000er-Fenster, im Plus-Abo verarbeitet das Reasoning-Modell mit 256.000 Tokens die komplette Datei, und Claude oder Gemini schlucken über die API auch das Zehnfache. Wer regelmäßig dicke PDFs analysieren lässt, etwa Ausschreibungen, Wartungsverträge oder Herstellerdokumentationen, sollte die Abo-Stufe deshalb nach dem Fenster auswählen, nicht nur nach dem Preis. Einen ausführlichen Vergleich der Abos samt Limits bietet unser Artikel Claude vs ChatGPT 2026 mit Preisen, Kontextfenstern und Nutzungslimits.

Viele Nutzer führen einen einzigen Dauer-Chat für alles, vom Angebotstext bis zur Reklamation. Genau dort schlägt das volle Fenster zu. Die KI vergisst Absprachen vom Gesprächsanfang, die Antworten werden unschärfer und das Nutzungskontingent schmilzt schneller, weil jede Nachricht den ganzen Verlauf erneut mitschickt.

Drei Faustregeln helfen im Alltag:

  • Pro Thema ein frischer Chat. Für das neue Angebot einen neuen Chat starten, statt den alten weiterzuführen. Das spart Limit und hält die Antworten präzise.
  • Wichtiges an den Anfang oder das Ende stellen. Die wichtigste Anweisung oder Frage gehört nicht in die Mitte eines langen Prompts, dort übersehen Modelle sie am ehesten.
  • Nur Relevantes hochladen. Statt zehn Dokumenten auf Verdacht lieber die zwei Dateien, um die es wirklich geht. Weniger Ballast im Fenster bringt bessere Antworten.

Bei langen Projekten lassen Sie sich am Ende einer Sitzung eine kurze Zusammenfassung des Stands geben und fügen diese als Startnachricht in den nächsten Chat ein. So bleibt das Wesentliche erhalten, ohne dass der alte Verlauf das Fenster füllt. Das gezielte Zusammenstellen dessen, was im Fenster landet, heißt Context Engineering.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?