Glossareintrag

Was bedeutet
Prompt-Caching bei KI/AI (Context Caching)?

Veröffentlicht: 17/08/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Prompt-Caching bei KI/AI (Context Caching)

Definition:

Prompt-Caching bei KI/AI (bei Google „Context Caching" genannt) ist eine Technik der großen KI-Anbieter, bei der sich wiederholende Anfangsteile eines Prompts auf dem Server zwischengespeichert werden, damit das KI-Modell sie nicht bei jeder Anfrage komplett neu durchrechnen muss. Laut Anthropics Angaben zum Prompt-Caching senkt das bei langen Prompts die Kosten um bis zu 90 Prozent und die Antwortzeit um bis zu 85 Prozent.

Prompt-Caching gibt es bei Anthropic (Claude), OpenAI (GPT-Modelle) und Google (Gemini). Steuern lässt es sich nur in der API, also der Schnittstelle für Entwickler und KI-Tools. In den Chat-Apps und in Werkzeugen wie Claude Code läuft es ohne Schalter im Hintergrund mit. Abonnenten bekommen dort zwar keine Rechnung pro Token, spüren den Effekt aber am Nutzungslimit, weil zwischengespeicherte Inhalte es weniger belasten.

Beschreibung:

Ein Sprachmodell verarbeitet jeden Prompt Token für Token von vorne nach hinten, und zwar bei jeder Anfrage aufs Neue. Viele KI-Anwendungen schicken aber mit jeder einzelnen Anfrage denselben großen Textblock mit, etwa eine feste Systemanweisung, eine Preisliste oder ein ganzes Dokument. Ohne Caching bezahlt der Betreiber diese unveränderten Tokens jedes Mal in voller Höhe und wartet jedes Mal, bis das Modell sie erneut durchgearbeitet hat.

Beim Prompt-Caching speichert der Anbieter das interne Zwischenergebnis dieser Verarbeitung, nicht die fertige Antwort. Kommt kurz darauf eine Anfrage, die exakt genauso beginnt, wird das gespeicherte Zwischenergebnis wiederverwendet (ein Cache-Hit) und nur der neue Teil der Anfrage wird berechnet. Weicht der Anfang auch nur um ein Zeichen ab, greift der Speicher nicht (Cache-Miss) und alles wird neu verarbeitet und voll bezahlt.

Aus diesem Grund funktioniert Caching nur für den Anfang des Prompts, das sogenannte Präfix. Das Modell baut sein Zwischenergebnis Schritt für Schritt auf, jeder Schritt hängt von allem davor ab. Ändert sich ein frühes Token, ist alles Nachfolgende ungültig. Daraus folgt die wichtigste Praxisregel: feste Inhalte an den Anfang, veränderliche Teile ans Ende. Der häufigste Fehler ist ein dynamischer Wert ganz vorne im Prompt, etwa die aktuelle Uhrzeit oder der Kundenname. Er macht jeden Cache-Treffer unmöglich, ohne dass es jemand merkt, denn die Anfragen funktionieren ja trotzdem, nur eben zum vollen Preis.

Die drei großen Anbieter setzen Prompt-Caching unterschiedlich um (Stand September 2026):

  • Anthropic (Claude): Caching wird per API-Parameter aktiviert, wahlweise automatisch oder mit selbst gesetzten Markierungen. Gecachte Tokens kosten 10 Prozent des normalen Eingabepreises. Bei Claude Fable 5.1 und Mythos 5.1 sind es seit September 2026 nur noch 2,5 Prozent. Das erstmalige Anlegen des Caches kostet 25 Prozent Aufschlag. Der Cache hält 5 Minuten, gegen den doppelten normalen Eingabepreis auch 1 Stunde, und jede Nutzung startet die Laufzeit neu; fällig wird dabei nur der günstige Lesepreis. Details stehen in der offiziellen Prompt-Caching-Dokumentation von Anthropic.
  • OpenAI (GPT-Modelle): Caching läuft laut OpenAI-Entwicklerdokumentation zum Prompt Caching ab 1.024 Tokens Prompt-Länge automatisch, ohne dass Entwickler etwas einbauen müssen. Gecachte Eingabe-Tokens kosten bei den aktuellen GPT-5-Modellen ebenfalls 10 Prozent des Normalpreises, bei älteren Modellen wie GPT-4o sind es 50 Prozent. Ab der Modellreihe GPT-5.6 hält der Cache mindestens 30 Minuten und das Anlegen kostet 25 Prozent Aufschlag. Bei älteren Modellen ist das Anlegen kostenlos und der Cache lässt sich ohne Aufpreis bis zu 24 Stunden vorhalten. Für GPT-6 Astra steuert seit September 2026 der Parameter prompt_cache_options.ttl die Haltezeit, der frühere prompt_cache_retention fällt weg.
  • Google (Gemini): Google fährt zweigleisig. Das implizite Caching läuft automatisch, garantiert aber keine Cache-Treffer. Beim expliziten Caching legt der Entwickler den Inhalt einmal als Cache-Objekt an, erhält garantiert 90 Prozent Rabatt auf gecachte Tokens und zahlt dafür eine Speichergebühr, die sich nach Tokenmenge und Stunde richtet. Die Speicherdauer ist laut Google-Dokumentation zum Context Caching frei wählbar.

Sehr kurze Prompts profitieren nicht. Alle Anbieter cachen erst ab einer Mindestlänge, je nach Anbieter und Modell zwischen 512 und 4.096 Tokens (bei OpenAI einheitlich 1.024). Kürzere Anfragen werden ganz normal verarbeitet und berechnet.

Es lohnt sich nur, wenn Folgeanfragen innerhalb der Cache-Lebensdauer eintreffen; bei seltenen oder einmaligen Anfragen zahlt man den Schreibaufschlag drauf, ohne je einen Treffer zu landen. Und der Prompt-Anfang muss wirklich identisch bleiben, schon eine umsortierte Formulierung im Systemtext macht den Speicher wertlos. Wie viel tatsächlich aus dem Cache kommt, zeigen die Anbieter in jeder API-Antwort in einem eigenen Zählfeld an, sodass Entwickler den Effekt kontrollieren können.

Prompt-Caching bei KI/AI (Context Caching) für Unternehmen und Handwerker:

Für lokale Unternehmen und Handwerksbetriebe wird Prompt-Caching in dem Moment wichtig, in dem ein eigenes KI-Werkzeug über die API läuft, denn dort entscheidet es direkt über die laufenden Kosten. Aber auch im Chat-Abo lohnt der Blick, obwohl dort niemand pro Token zahlt. Wiederkehrende Unterlagen gehören in ein Projekt, denn Anthropic speichert Projektinhalte zwischen und rechnet sie bei Wiederverwendung nicht gegen das Nutzungslimit. Welche Handgriffe den Cache sonst noch warm halten und warum ein Treffer bei Claude Fable 5.1 nur noch 2,5 Prozent des Eingabepreises kostet, steht im Ratgeber Mit Prompt Caching Kosten sparen.

Das typische Beispiel ist ein Chatbot auf der Firmenwebsite. Damit er kompetent antwortet, schickt er bei jeder Kundenfrage das komplette Firmenwissen mit, also Leistungen, Einzugsgebiet, Preisspannen und häufige Fragen. Da kommen schnell 10.000 Tokens zusammen. Bei 200 Kundenfragen am Tag sind das 2 Millionen Eingabe-Tokens täglich und 60 Millionen im Monat, allein für den immer gleichen Wissensblock. Was das kostet, zeigt die Preisliste von Anthropic. Mit Prompt-Caching schrumpft dieser Posten auf rund ein Zehntel, sofern die Anfragen dicht genug aufeinanderfolgen, dass der Cache zwischendurch nicht verfällt. Welche Preisunterschiede zwischen den Anbietern generell bestehen, zeigt der Vergleich Claude vs. ChatGPT 2026 mit allen API-Kosten.

Wer den Chatbot oder die KI-Automatisierung nicht selbst baut, sondern von einer Agentur betreiben lässt, kann das Thema im Gespräch prüfen. Rechnet der Dienstleister nach API-Verbrauch ab, ist die Frage berechtigt, ob Prompt-Caching aktiv ist. Bei OpenAI und Gemini läuft ein Grund-Caching automatisch, bei Claude muss der Entwickler es bewusst aktivieren.

Auch fertige KI-Produkte profitieren im Hintergrund davon. Coding-Assistenten, KI-Agenten und Dokument-Tools halten auf diese Weise lange Gesprächsverläufe und große Wissensbestände bezahlbar, was sich letztlich in den Abo-Preisen dieser Werkzeuge niederschlägt. Wie Nutzer den Effekt selbst steuern können, zeigt unsere Anleitung, mit der Sie in Claude Code Token sparen und das Abo-Limit schonen.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?