Glossareintrag
Wir denken. KI tippt mit.
Erklärbare KI (englisch Explainable AI, kurz XAI) bezeichnet Methoden und Werkzeuge, die nachvollziehbar machen, wie ein KI-Modell zu einer bestimmten Entscheidung, Vorhersage oder Antwort kommt. Sie beantwortet Fragen wie „Warum lehnt das Modell diesen Kreditantrag ab?“ oder „Warum sortiert es genau diese Bewerbung aus?“. Das Gegenstück ist die Black Box, ein System, das Ergebnisse liefert, ohne seinen Entscheidungsweg offenzulegen. (Hinweis: Verwechselbar mit xAI, der KI-Firma im SpaceX-Konzern. Hier geht es um das Fachkonzept.)
Nötig wird das, weil tiefe neuronale Netze Millionen bis Milliarden Parameter verrechnen, deren Zusammenspiel kein Mensch direkt ablesen kann. Als Fachbegriff verbreitete sich XAI ab 2016 durch ein Forschungsprogramm der US-Militärforschungsagentur DARPA. Dessen Ziel war, dass Nutzer KI-Systeme „verstehen, angemessen vertrauen und effektiv steuern“ können.
Drei verwandte Begriffe werden oft vermischt. Interpretierbar ist ein Modell, dessen Rechenweg sich direkt nachvollziehen lässt, z. B. ein Entscheidungsbaum. Erklärbar heißt, dass auch für ein Black-Box-Modell nachträglich verständliche Begründungen erzeugt werden. Transparenz meint die Offenlegung von Rahmeninformationen wie Trainingsdaten, Einsatzzweck und Grenzen, z. B. in einer Model Card.
XAI kennt zwei Grundwege. Entweder wird von vornherein ein Modell gewählt, das ein Mensch direkt lesen kann, z. B. ein lineares Modell oder ein Entscheidungsbaum. Oder ein leistungsstarkes Black-Box-Modell wird nachträglich analysiert, im Fachjargon Post-hoc-Erklärung. Drei Post-hoc-Methoden aus der Forschung der Jahre 2016 bis 2018 haben sich als Standard durchgesetzt:
Für die Qualität solcher Erklärungen gibt es seit 2021 einen offiziellen Maßstab. Das US-Standardinstitut NIST nennt in seinem Bericht „Four Principles of Explainable Artificial Intelligence“ vier Anforderungen. Ein System soll Begründungen liefern, diese müssen für den Empfänger verständlich sein, sie müssen den tatsächlichen Rechenweg korrekt wiedergeben, und das System soll nur innerhalb seiner Einsatzgrenzen arbeiten. Seit September 2025 ergänzt die internationale technische Spezifikation ISO/IEC TS 6254 die Ziele und Ansätze der Erklärbarkeit.
Bei großen Sprachmodellen stoßen die klassischen Methoden an Grenzen. Ein Large Language Model hat keine benannten Eingabemerkmale wie „Einkommen“ oder „Alter“, auf die sich SHAP-Werte sinnvoll verteilen ließen. Hinzu kommt die Polysemantik. Einzelne Neuronen reagieren auf viele unzusammenhängende Konzepte gleichzeitig, und ein einzelnes Konzept verteilt sich über viele Neuronen.
Auch die Begründungen, die Chatbots selbst mitliefern, sind keine Erklärungen im XAI-Sinn. Reasoning-Modelle legen zwar ihre Denkschritte offen. Eine Anthropic-Studie zur Verlässlichkeit dieser Denkketten schob Modellen 2025 aber versteckte Lösungshinweise unter und prüfte, ob sie deren Nutzung offenlegen. Claude 3.7 Sonnet erwähnte den genutzten Hinweis nur in 25 Prozent der Fälle, DeepSeek R1 in 39 Prozent. Die ausgegebene Begründung kann also vom tatsächlichen Entscheidungsweg abweichen. Trotzdem prüfen die Anbieter diese Denkschritte automatisch auf verdächtige Absichten (Chain-of-Thought-Monitoring).
Die Antwort der Forschung darauf heißt mechanistische Interpretierbarkeit. Sie untersucht das Modellinnere direkt, statt Erklärungen von außen anzunähern. Anthropic extrahierte 2024 Millionen interpretierbarer „Features“ aus Claude 3 Sonnet, einzelne Konzept-Schalter, die sich gezielt verstärken lassen. In der Demo „Golden Gate Claude“ baute das Modell nach Verstärkung eines einzigen Features die Golden Gate Bridge in fast jede Antwort ein. 2025 folgten „Attribution Graphs“, eine Art Schaltplan für einzelne Antworten, deren Analyse-Werkzeuge Anthropic quelloffen veröffentlicht hat. Google DeepMind stellt mit Gemma Scope über 400 offene Analyse-Bausteine für seine Gemma-Modelle bereit. OpenAI trainiert kleine, extrem ausgedünnte Forschungsmodelle, deren Schaltkreise Menschen vollständig nachlesen können.
Anthropic berichtet allerdings selbst, dass die Schaltplan-Methode nur bei einem Teil der untersuchten Eingaben befriedigende Einblicke liefert. Und auch klassische Post-hoc-Erklärungen wie LIME und SHAP sind Näherungen, die den echten Rechenweg vereinfachen und im Einzelfall in die Irre führen können.
Parallel macht die Regulierung Erklärbarkeit zur Pflicht. Der EU AI Act verlangt in Artikel 13, dass Hochrisiko-Systeme so transparent arbeiten, dass Betreiber die Ausgaben interpretieren können. Artikel 86 gibt Betroffenen ein Recht auf Erläuterung der Entscheidungsfindung im Einzelfall, wenn eine Hochrisiko-KI an einer Entscheidung mit rechtlicher oder ähnlich erheblicher Wirkung beteiligt war. Die Hochrisiko-Pflichten sollten ursprünglich ab dem 2. August 2026 greifen. Die „Digital Omnibus“-Änderungsverordnung, in Kraft seit dem 27. Juli 2026, hat sie auf den 2. Dezember 2027 (eigenständige Systeme) und den 2. August 2028 (in Produkte eingebettete Systeme) verschoben.
Aus dem Datenschutzrecht kommt eine zweite Säule. Der Europäische Gerichtshof entschied im Dezember 2023 zum SCHUFA-Scoring, dass schon die automatisierte Berechnung eines Score-Werts eine automatisierte Einzelentscheidung nach Artikel 22 DSGVO sein kann (EuGH-Urteil C-634/21). Betroffene haben dann Anspruch auf aussagekräftige Informationen über die involvierte Logik und auf eine menschliche Überprüfung. Ob die DSGVO zusätzlich ein allgemeines „Recht auf Erklärung“ enthält, ist unter Juristen seit Jahren umstritten.
Am häufigsten begegnet Erklärbare KI lokalen Unternehmen als eigenes Recht gegenüber fremden KI-Systemen. Lehnt eine Bank den Betriebskredit ab und stützt sich dabei maßgeblich auf einen automatisch berechneten Score, greifen seit dem SCHUFA-Urteil des EuGH die Auskunftsrechte der DSGVO. Sie können verlangen, dass Ihnen die wesentlichen Gründe verständlich dargelegt werden und ein Mensch die Entscheidung überprüft. Eine brauchbare Erklärung hat dabei die Form der kontrafaktischen Frage („Bei welcher Änderung wäre der Kredit bewilligt worden?“), nicht die einer Formel.
Beim Einsatz eigener KI-Tools dreht sich die Rolle. Nutzt Ihr Betrieb Software mit KI-Funktionen für die Personalauswahl, stuft der EU AI Act das als Hochrisiko-Anwendung ein, mit Interpretations- und Aufsichtspflichten für den Betreiber. Aussortierte Bewerber können sich zusätzlich auf das AGG berufen, wenn ein Bias im System bestimmte Gruppen benachteiligt. Wer solche Werkzeuge einkauft, fragt den Anbieter deshalb am besten schon vor dem Kauf nach den Erklär-Funktionen, z. B. nach einer Merkmals-Gewichtung je Einzelfall.
Auch Versicherer müssen ihre KI erklären können. Die EU-Versicherungsaufsicht EIOPA verlangt in ihrer Stellungnahme zu KI-Governance und Risikomanagement vom August 2025, dass Versicherer die Ergebnisse ihrer KI-Systeme gegenüber Kunden klar und verständlich erklären. Für Betriebe zählt das bei Gewerbeversicherungen und in der Schadenregulierung, sobald eine KI Beitragshöhe oder Auszahlung mitbestimmt.
Im Alltag mit ChatGPT, Claude und Co. gilt eine einfache Faustregel. Die Begründung, die der Chatbot mitliefert, ist Teil der generierten Antwort und keine geprüfte Erklärung seines Rechenwegs. Fachliche Angaben deshalb immer gegenprüfen, bevor sie in Angebote oder Kundenkommunikation wandern, auch wegen des Risikos des Halluzinierens. Laut der globalen KPMG-Vertrauensstudie 2025 (über 48.000 Befragte in 47 Ländern) nutzen 66 Prozent der Menschen regelmäßig KI, aber nur 46 Prozent sind bereit, ihr zu vertrauen.