Glossareintrag
Wir denken. KI tippt mit.
Ein Reasoning-Modell ist ein KI-Sprachmodell, das vor der eigentlichen Antwort intern „nachdenkt". Es erzeugt zuerst eine für den Nutzer unsichtbare Denkkette (englisch Chain of Thought), in der es die Aufgabe in Einzelschritte zerlegt, verschiedene Lösungswege abwägt und eigene Fehler korrigiert. Erst danach gibt es die fertige Antwort aus. Das englische Wort Reasoning bedeutet logisches Schlussfolgern, im Deutschen spricht man auch von KI-Denkmodell oder Thinking-Modell.
Die Modellklasse entstand im September 2024 mit OpenAI o1, dem ersten Reasoning-Modell für die breite Öffentlichkeit. Ein klassisches Large Language Model (LLM) beginnt sofort mit der Ausgabe und schreibt Wort für Wort drauflos. Ein Reasoning-Modell investiert dagegen zusätzliche Rechenzeit in das Durchdenken der Aufgabe und liefert dadurch bei komplexen Problemen deutlich zuverlässigere Ergebnisse.
Technisch erzeugt ein Reasoning-Modell beim Denken sogenannte Thinking-Tokens, also zusätzliche Tokens (Textbausteine), die nie in der sichtbaren Antwort auftauchen. Je mehr Denkzeit ein Modell bekommt, desto besser wird das Ergebnis. Fachleute nennen dieses Prinzip Test-Time-Compute, weil die zusätzliche Rechenleistung nicht ins Training fließt, sondern in den Moment der Antwort. Antrainiert wird das Denken per Reinforcement Learning, das Modell wird also dafür belohnt, wenn seine Denkkette zum richtigen Ergebnis führt. Dass dieser Ansatz funktioniert, hat das chinesische KI-Unternehmen DeepSeek im September 2025 mit seinem Modell R1 als erster Anbieter in der wissenschaftlich begutachteten Fachzeitschrift Nature nachgewiesen (peer-reviewte Studie zu DeepSeek R1).
Wie groß der Sprung ist, zeigen Mathe- und Wissenschafts-Tests. Beim Mathematik-Wettbewerb AIME löste das erste Reasoning-Modell o1 laut OpenAI 74 Prozent der Aufgaben, das damalige Standardmodell GPT-4o nur 12 Prozent. Auch bei GPQA, einem KI-Benchmark für Expertenwissen, überholte es erstmals promovierte Fachleute. Die Details stehen in OpenAIs Forschungsbericht „Learning to reason with LLMs".
Stand August 2026 haben alle großen Anbieter Reasoning eingebaut:
Der Trend geht dabei weg vom separaten Spezialmodell. Aktuelle Systeme entscheiden zunehmend selbst, ob sich Nachdenken lohnt, und überspringen es bei einfachen Fragen komplett. Dieselbe Fähigkeit ist auch die Grundlage für KI-Agenten, die mehrschrittige Aufgaben selbstständig abarbeiten, denn ohne internes Planen kommt kein Agent durch eine längere Aufgabenkette.
Das Denken hat seinen Preis. Thinking-Tokens werden bei allen großen Anbietern als Output-Tokens abgerechnet, obwohl sie unsichtbar bleiben. Eine kurz aussehende Antwort kann so intern mehrere zehntausend Tokens verbraucht haben, und je höher die Denkstufe, desto länger die Wartezeit. Für Chat-Abos mit Pauschalpreis spielt das kaum eine Rolle, für Firmen mit API-Anbindung ist es ein echter Kostenfaktor.
Zwei Einschränkungen sollten Sie kennen. Erstens ist die angezeigte Denkspur in den Apps meist eine Zusammenfassung und nicht das vollständige interne Protokoll, und eine nachvollziehbare Begründung ist keine Garantie für ein richtiges Ergebnis. Auch ein Modell mit langer Denkphase kann halluzinieren, also Fakten überzeugend frei erfinden. Zweitens fanden Apple-Forscher im Juni 2025 in der Studie „The Illusion of Thinking", dass die Genauigkeit von Reasoning-Modellen bei sehr komplexen Logik-Puzzles schlagartig einbricht. Andere Forscher halten diesen Befund teilweise für ein Artefakt des Versuchsaufbaus, die wissenschaftliche Debatte läuft noch.
Seit GPT-6 Astra kommt eine dritte Beobachtung dazu. Laut der System Card löst das Modell Aufgaben zunehmend ohne geschriebene Denkkette, für die frühere Modelle eine brauchten. Der Zeithorizont solcher Aufgaben ist nach Messungen des UK AI Security Institute um rund eine Größenordnung gewachsen. OpenAI schreibt selbst, bei anhaltendem Trend werde man Fehlverhalten mit den heutigen Mitteln deutlich schlechter erkennen. Das Mitlesen dieser Denkkette heißt Chain-of-Thought-Monitoring.
Nicht verwechseln sollten Sie Reasoning-Modelle mit dem älteren Prompt-Trick, einem Standardmodell „Denk Schritt für Schritt" in den Prompt zu schreiben. Diese Anweisung macht die Ausgabe zwar strukturierter, echtes Reasoning ist aber antrainiert und findet vor der Antwort statt, nicht in ihr.
Der Denkmodus lohnt sich überall dort, wo eine Aufgabe mehrere Schritte, Abhängigkeiten oder Fallstricke hat, und ist bei Routineaufgaben verzichtbar. Als Faustregel für den Betriebsalltag eignet sich die Frage, ob Sie selbst für die Aufgabe einen Zettel und zehn Minuten Ruhe bräuchten. Wenn ja, schalten Sie das Denken ein:
Für kurze E-Mails, Textentwürfe, Übersetzungen oder einfache Wissensfragen lassen Sie den Denkmodus dagegen aus. Das Ergebnis wird nicht besser, Sie warten nur länger, und bei API-Nutzung zahlen Sie für unsichtbare Denk-Tokens mit.
Der Einstieg kostet nichts. Bei Claude denkt das Modell auch im Gratis-Plan bei Bedarf automatisch mit, Google hat die wählbaren Denkstufen (Thinking Level) in der Gemini-App für alle Nutzer freigeschaltet und in Microsoft Copilot ist der Denkmodus ebenfalls kostenlos enthalten. Bei ChatGPT bekommen seit August 2026 auch Gratis-Nutzer einen Think-Knopf mit GPT-5.6 Luna. Die stärksten Denkmodelle bleiben den Bezahl-Abos vorbehalten, GPT-6 Astra im Chat sogar erst ab dem Pro-Tarif. Welche Stufen welcher Tarif freischaltet, steht auf der deutschen Tarifseite von ChatGPT. Wie sich die Anbieter bei Preisen und Stärken insgesamt unterscheiden, zeigt unser ausführlicher Vergleich von Claude und ChatGPT mit allen Preisen und API-Kosten. Was der besonders gründliche Gemini-Modus Deep Think kann und wo Sie ihn in der App finden, erklärt die offizielle Google-Hilfeseite zu Gemini Deep Think.
Ein praktischer Tipp zum Schluss. Lassen Sie sich die Denkspur ruhig anzeigen und überfliegen Sie sie bei wichtigen Ergebnissen. Wenn das Modell dort von falschen Annahmen ausgeht, etwa einem falschen Stundensatz in der Kalkulation, erkennen Sie den Fehler früher als in der fertigen Antwort.