Glossareintrag

Was bedeutet
Synthetische Trainingsdaten bei KI/AI (Synthetic Data, Model Collapse)?

Veröffentlicht: 21/08/2026
Aktualisiert: 27/08/2026

Wir denken. KI tippt mit.

Synthetische Trainingsdaten bei KI/AI (Synthetic Data, Model Collapse)

Definition:

Synthetische Trainingsdaten (englisch Synthetic Data) sind künstlich erzeugte Daten, mit denen KI-Modelle trainiert werden, anstelle von oder zusätzlich zu echten Trainingsdaten aus dem Web oder aus dem Leben echter Menschen. Erzeugt werden sie von einem starken KI-Modell, das Texte, Aufgaben und Musterlösungen für das Training eines anderen Modells schreibt. Von Simulationen, die etwa Sensordaten für Roboter und selbstfahrende Autos berechnen, oder von statistischen Verfahren, die die Muster einer echten Datensammlung nachbilden, ohne einzelne echte Datensätze zu übernehmen. Im Unterschied zur Anonymisierung, die vorhandene Datensätze verfremdet, haben vollsynthetische Daten kein direktes Gegenstück in der Wirklichkeit.

Model Collapse (deutsch Modellkollaps) bezeichnet das bekannteste Risiko dieser Methode. Trainiert eine Modellgeneration wahllos auf den Ausgaben der vorherigen, verschwinden seltene Inhalte zuerst, Fehler schaukeln sich über die Generationen auf, und im Extremfall liefert das Modell nur noch gleichförmigen, unbrauchbaren Text. (Hinweis: Model Collapse ist eine unbeabsichtigte Nebenwirkung und nicht zu verwechseln mit Data Poisoning, dem absichtlichen Einschleusen manipulierter Daten durch Angreifer.)

Beschreibung:

Die KI-Branche setzt auf synthetische Trainingsdaten, weil der Vorrat an menschengemachtem Text endlich ist. Das Forschungsinstitut Epoch AI beziffert den nutzbaren Bestand an öffentlichem, von Menschen geschriebenem Text auf rund 300 Billionen Tokens und erwartet in seiner Studie zur Datenknappheit, dass die großen KI-Labore diesen Vorrat zwischen 2026 und 2032 vollständig ausgeschöpft haben. Neben der Knappheit sprechen Datenschutz und Kosten für künstliche Daten, denn sie enthalten keine Angaben zu echten Personen und ersparen einen Teil der teuren Handarbeit beim Sammeln und Beschriften.

Microsofts Sprachmodell Phi-4 bezog im Pre-Training 40 Prozent seines Datenmixes aus synthetischen Quellen, laut Phi-4 Technical Report rund 400 Milliarden Tokens aus 50 eigens erzeugten Datensatz-Typen; in Wissenstests übertrifft das fertige Modell sogar sein Lehrermodell. Meta gewann Llama 4 Maverick laut der offiziellen Llama-4-Ankündigung per Destillation aus dem deutlich größeren Schwestermodell Behemoth, und Nvidia stellt seine Nemotron-Modelle mit einer Lizenz bereit, die das Erzeugen synthetischer Trainingsdaten für eigene Modelle ausdrücklich erlaubt.

Das Risiko des Model Collapse beschrieb ein Team um Ilia Shumailov im Juli 2024 in einer vielzitierten Nature-Studie. Die Forscher trainierten ein kleines Sprachmodell auf Wikipedia-Texten und fütterten jede folgende Modellgeneration mit den Ausgaben der vorherigen. In der neunten Generation antwortete das Modell auf einen Text über mittelalterliche Kirchtürme nur noch mit Aufzählungen von Hasenarten. Dabei verschwinden zuerst unbemerkt die seltenen Randfälle der Daten, Fachleute sprechen vom frühen Kollaps, erst im späten Kollaps bricht die sichtbare Qualität ein und die Ausgaben werden gleichförmig. Für so degenerierte Systeme hat sich in der Fachwelt der Spottname „Habsburg AI" verbreitet, eine Anspielung auf die Folgen der Heiratspolitik im Adelsgeschlecht der Habsburger.

In der Praxis trainiert allerdings kein Labor so, wie es das Experiment unterstellt. Der Kollaps trat auf, weil die echten Daten vollständig durch künstliche ersetzt wurden; behielten die Forscher nur 10 Prozent Originaldaten bei, blieb der Qualitätsverlust gering. Eine Folgestudie zum Model Collapse von 2024 zeigte zudem, dass der Fehler begrenzt bleibt, wenn synthetische Daten die echten ergänzen statt ersetzen. Die großen Labore filtern ihre künstlichen Daten deshalb streng und mischen sie mit menschlichem Material; die Ergebnisse der Phi-Reihe zeigen, dass sorgfältig kuratierte synthetische Daten die Qualität eines Modells sogar heben können.

Das offene Web füllt sich unterdessen mit KI-Text und damit mit Trainingsmaterial aus zweiter Hand. Eine Auswertung der Analysefirma Graphite vom Mai 2026 kommt zu dem Ergebnis, dass seit Anfang 2025 stabil rund die Hälfte der neu veröffentlichten englischsprachigen Webartikel KI-generiert ist. Die KI-Anbieter kennzeichnen eigene Ausgaben deshalb zunehmend mit KI-Wasserzeichen und kaufen sich zugleich Zugang zu frischem menschlichem Material, Google zahlt laut einem Bericht von CBS News rund 60 Millionen US-Dollar für das Training mit Reddit-Beiträgen.

Synthetische Trainingsdaten bei KI/AI (Synthetic Data, Model Collapse) für Unternehmen und Handwerker:

Für Betriebe sind synthetische Daten vor allem ein Datenschutz-Werkzeug. Wer eine neue Software testen, eine Auswertung an einen Dienstleister geben oder ein eigenes KI-Projekt starten will, darf echte Kundendaten dafür oft gar nicht verwenden; statistisch nachgebildete Datensätze mit denselben Mustern lösen das Problem, weil sie keiner echten Person zugeordnet sind. Werkzeuge dafür gibt es auch kostenlos:

  • Mostly AI: Plattform mit quelloffenem Software-Baukasten (Apache-2.0-Lizenz) und eingebautem Schutz gegen Rückschlüsse auf Einzelpersonen, zum Ausprobieren auf mostly.ai.
  • SDV (Synthetic Data Vault): Python-Bibliothek aus dem Umfeld des MIT, die Tabellendaten wie Kunden- oder Auftragslisten statistisch nachbildet.

(Hinweis: Synthetisch heißt nicht automatisch anonym. Ob die DSGVO greift, hängt davon ab, ob sich aus den erzeugten Daten einzelne Personen rekonstruieren lassen; das sollte vor der Weitergabe geprüft werden.)

Für die Inhalte des eigenen Betriebs bedeutet die Entwicklung eine Aufwertung. Rund die Hälfte der neuen Webtexte stammt inzwischen aus KI-Systemen, und dieselbe Graphite-Auswertung zeigt, dass rein KI-generierte Artikel in der Google-Suche und in ChatGPT-Antworten kaum auftauchen. Wer eigene Erfahrungen, echte Baustellenfotos, Projektberichte und Kundenstimmen veröffentlicht, liefert genau die seltenen Randfälle, die künstlicher Einheitstext nicht bieten kann, und wird damit für Suchmaschinen wie für KI-Assistenten als Quelle wertvoller.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?