Glossareintrag
Wir denken. KI tippt mit.
Halluzinieren bedeutet bei künstlicher Intelligenz, dass ein KI-System Informationen erfindet und sie so überzeugend formuliert, als wären sie belegte Fakten. Das Modell nennt dann Quellen, die nicht existieren, Zahlen, die nie gemessen wurden, oder Gerichtsurteile, die nie gefällt wurden, und klingt dabei genauso sicher wie bei einer richtigen Antwort. Eine einzelne solche Erfindung heißt Halluzination, englisch AI hallucination. Das Cambridge Dictionary kürte „hallucinate" wegen dieser neuen KI-Bedeutung sogar zum Wort des Jahres 2023.
Die Ursache steckt im Grundprinzip von Sprachmodellen wie ChatGPT, Claude oder Gemini. Ein Large Language Model berechnet Wort für Wort die wahrscheinlichste Fortsetzung eines Textes und optimiert damit auf Plausibilität, nicht auf Wahrheit. Manche Fachleute halten deshalb „Konfabulation" für den treffenderen Begriff, angelehnt an die Neuropsychologie, wo Menschen Gedächtnislücken unbewusst mit erfundenen, aber stimmigen Geschichten füllen. Durchgesetzt hat sich diese Bezeichnung allerdings nicht.
Warum Sprachmodelle lieber raten als schweigen, hat OpenAI im September 2025 in der Forschungsarbeit „Why Language Models Hallucinate" untersucht. Training und Vergleichstests bewerten KI-Modelle demnach wie Multiple-Choice-Prüfungen, bei denen „Ich weiß es nicht" null Punkte bringt, eine selbstbewusst geratene Antwort aber punkten kann. Die Modelle werden so zu guten Testteilnehmern erzogen, die im Zweifel raten. Die Autoren schlagen deshalb vor, solche Tests so umzubauen, dass ehrliche Unsicherheit belohnt wird, denn ein Modell, das bei Wissenslücken passt, halluziniert deutlich seltener.
Anthropic hat den Mechanismus 2025 sogar im Modellinneren sichtbar gemacht. Bei Claude ist eine Verweigerungs-Schaltung standardmäßig aktiv, die bei fehlendem Wissen eine Antwort wie „Das kann ich nicht sicher beantworten" auslöst. Erkennt das Modell aber einen Namen oder Begriff wieder, schaltet ein Signal für „bekannte Entität" diese Verweigerung ab, und zwar auch dann, wenn zu dem Namen gar kein echtes Wissen gespeichert ist. Genau in diesem Moment entsteht die Halluzination, das Modell füllt die Lücke mit einer plausiblen, erfundenen Antwort. Die Details stehen in der Anthropic-Forschungsarbeit „Tracing the thoughts of a large language model".
Wie häufig Modelle halluzinieren, hängt stark von der Aufgabe ab. Beim Zusammenfassen vorgelegter Dokumente liegen die Quoten erfundener Angaben laut dem Vectara Hallucination Leaderboard je nach Modell zwischen knapp 2 und über 20 Prozent (Stand Mai 2026). Bei freien Wissensfragen ohne Textvorlage sind die Fehlerraten um ein Vielfaches höher. OpenAI dokumentierte im April 2025 in der eigenen Systemkarte, dass das Denkmodell (Reasoning-Modell) o3 bei Fragen zu Personen in 33 Prozent der Fälle halluzinierte und o4-mini in 48 Prozent, während der Vorgänger o1 auf 16 Prozent kam. Die neueren Modelle waren hier also unzuverlässiger als ihr Vorgänger. Die Nachfolgegeneration drehte den Trend wieder, GPT-5 macht im Denkmodus laut Systemkarte vom August 2025 über fünfmal weniger Faktenfehler als o3, und mit eingeschalteter Websuche sinken die Quoten zusätzlich.
Die Folgen sind längst gerichtsfest dokumentiert. 2023 reichten New Yorker Anwälte im Verfahren Mata gegen Avianca von ChatGPT erfundene Gerichtsurteile ein und mussten 5.000 Dollar Strafe zahlen. Inzwischen ist daraus ein Massenphänomen geworden, die öffentliche Fall-Datenbank des Rechtsforschers Damien Charlotin zählte im Juli 2026 weltweit über 1.600 Gerichtsverfahren mit erfundenen KI-Zitaten. Auch deutsche Gerichte sind betroffen. Das Landgericht Frankfurt wertete im September 2025 einen Anwaltsschriftsatz mit nicht existierenden BGH-Entscheidungen als Verstoß gegen anwaltliche Grundpflichten, das Kammergericht Berlin ermahnte im November 2025 eine Anwältin wegen erfundener Rechtsprechungszitate. Einer breiten Öffentlichkeit bekannt wurde das Phänomen im Mai 2024, als Googles KI-Suchzusammenfassung empfahl, Kleber in die Pizzasauce zu rühren. Die Empfehlung stammte aus einem alten Scherz-Beitrag auf Reddit.
Nicht jede falsche KI-Antwort ist übrigens eine Halluzination. Nennt ein Modell einen veralteten Preis, weil sein Trainingswissen bei einem älteren Stand endet, ist das schlicht altes Wissen. Und liefert es am Thema vorbei, weil die Aufgabe unklar gestellt war, liegt das Problem beim Prompt. Von Halluzination spricht man, wenn das Modell Inhalte erfindet, die es in dieser Form nie gelernt hat.
Für lokale Betriebe ist die Halluzination das größte Alltagsrisiko beim KI-Einsatz, weil erfundene Angaben schnell den Weg nach draußen finden. Typische Gefahrenstellen sind Angebots- und Websitetexte mit falschen Preisen oder Leistungsdaten, technische Unterlagen mit erfundenen DIN- oder VDE-Normen sowie Auskünfte zu Gewährleistung, VOB oder Steuerfragen, die sich juristisch korrekt anhören, aber frei erfunden sind. In der Deutschen Handwerks-Zeitung berichten Handwerksbetriebe, dass Texte aus ChatGPT vor der Verwendung grundsätzlich nachkorrigiert werden müssen. Normen, Rechtsangaben und Preise gehören dabei ausnahmslos auf den eigenen Prüftisch.
Wie teuer ungeprüfte KI-Aussagen werden können, zeigen die ersten Urteile. Air Canada musste 2024 einem Kunden Geld erstatten, weil der Website-Chatbot der Airline eine Erstattungsregel erfunden hatte, die Schlichtungsstelle ließ die Ausrede nicht gelten, der Bot sei eine eigene Rechtsperson. In Deutschland entschied das Landgericht Kiel bereits im Februar 2024, dass ein Unternehmen für vollautomatisch per KI erzeugte Falschinformationen haftet, ein Warnhinweis schützt nicht. Das Oberlandesgericht Hamm ging im Mai 2026 noch einen Schritt weiter, als der Chatbot einer Klinik einen nicht existierenden Facharzt-Titel erfand, und stufte das als irreführende geschäftliche Handlung ein, für die der Betreiber voll haftet (die Revision zum BGH wurde zugelassen). Wer KI-Texte ungeprüft an Kunden weitergibt, macht sich den Inhalt rechtlich zu eigen. Der eigene Chatbot auf der Firmenwebsite spricht vor Gericht mit der Stimme des Betriebs.
Für den Betriebsalltag hat sich eine einfache Prüfroutine bewährt:
Die Werkzeuge dafür kosten nichts mehr. ChatGPT, Claude, Gemini, Microsoft Copilot und Perplexity bieten inzwischen alle eine Websuche mit klickbaren Quellenlinks, bei Claude laut Anthropic seit Mai 2025 auch im Gratis-Plan. Das wirkt messbar, OpenAI weist in der GPT-5-Systemkarte deutlich niedrigere Fehlerquoten bei eingeschalteter Websuche aus. Einen Schritt weiter geht Googles kostenloses NotebookLM, das ausschließlich aus Dokumenten antwortet, die Sie selbst hochladen, und seine Aussagen mit Zitatstellen im Original belegt. Das eignet sich gut für Fragen an eigene Preislisten, Verträge oder Herstellerunterlagen.
Ganz abstellen lässt sich das Halluzinieren nach heutigem Stand nicht, auch nicht mit Bezahlversionen. Behandeln Sie jeden KI-Text deshalb als Zuarbeit, nicht als geprüftes Endprodukt. Wie zuverlässig die aktuellen Modelle von OpenAI und Anthropic im Vergleich antworten, zeigt der Beitrag Claude vs ChatGPT 2026. Die Verantwortung für die Fakten gegenüber Ihren Kunden bleibt in jedem Fall beim Betrieb.