Glossareintrag
Wir denken. KI tippt mit.
Scaling Laws (deutsch Skalierungsgesetze) sind empirisch gefundene Gesetzmäßigkeiten, nach denen KI-Modelle vorhersagbar besser werden, je mehr Rechenleistung, Trainingsdaten und Modellgröße in ihr Training fließen. Der Fehler eines großen Sprachmodells sinkt dabei entlang einer glatten mathematischen Kurve, einem sogenannten Potenzgesetz, solange die drei Zutaten gemeinsam wachsen.
Für die KI-Labore sind Scaling Laws so etwas wie eine Landkarte. Sie trainieren kleine Testmodelle, vermessen die Kurve und rechnen daraus hoch, was ein hundertfach größeres Modell leisten wird, bevor sie dreistellige Millionenbeträge in das eigentliche Training stecken.
Der Begriff stammt aus der KI-Forschung. Skalierungsgesetze aus Physik und Biologie, die etwa das Verhältnis von Körpergröße und Stoffwechsel beschreiben, sind hier nicht gemeint, auch wenn sie mathematisch verwandt sind.
Als Geburtsstunde des Begriffs gilt das Forschungspapier „Scaling Laws for Neural Language Models" von Kaplan et al., das ein Team um den Physiker Jared Kaplan bei OpenAI im Januar 2020 veröffentlichte. Die Forscher wiesen über viele Größenordnungen hinweg nach, dass die Leistung eines Sprachmodells verlässlich steigt, wenn Parameterzahl, Datenmenge und Rechenaufwand zusammen erhöht werden. Erste Hinweise auf diese Vorhersagbarkeit hatte 2017 bereits ein Forscherteam bei Baidu geliefert. Das Kaplan-Papier lieferte die wissenschaftliche Begründung für GPT-3 und löste den Wettlauf um immer größere Modelle aus.
2022 korrigierte Googles KI-Labor DeepMind das Bild mit dem sogenannten Chinchilla-Paper. Die zentrale Erkenntnis lautet, dass die Branche ihre Modelle jahrelang zu groß gebaut und zu kurz trainiert hatte. Optimal ist demnach ein Verhältnis von rund 20 Trainings-Tokens pro Parameter. Als Beleg trainierte DeepMind das Modell Chinchilla mit 70 Milliarden Parametern auf der vierfachen Datenmenge und schlug damit bei identischem Rechenaufwand das viermal größere Schwestermodell Gopher.
Heute spricht die Branche von drei Skalierungs-Hebeln, eine Einteilung, die vor allem Nvidia-Chef Jensen Huang mit seinen Keynotes bekannt gemacht hat. Beim Pre-Training-Scaling wächst das Grundtraining selbst, also Daten, Parameter und Rechenleistung. Beim Post-Training-Scaling wird ein fertiges Basismodell durch Verstärkungslernen und Feinschliff weiter verbessert. Und beim Test-Time-Scaling denkt das Modell bei der Antwort länger nach und investiert mehr Rechenzeit pro Anfrage. Diesen dritten Weg etablierte OpenAI im September 2024 mit o1, dem ersten Reasoning-Modell.
Zwischenzeitlich galt das klassische Skalieren als ausgereizt. Ende 2024 berichteten US-Medien, OpenAIs internes Riesenmodell Orion bringe deutlich kleinere Sprünge als beim Schritt von GPT-3 zu GPT-4 erhofft; es erschien im Februar 2025 als GPT-4.5. KI-Pionier Ilya Sutskever erklärte im Dezember 2024, das Pre-Training in seiner bekannten Form werde enden, weil das Internet als Datenquelle ausgeschöpft sei. OpenAI-Chef Sam Altman hielt mit dem knappen Satz „there is no wall" dagegen. Tatsächlich verlagerte sich der Fortschritt 2024 und 2025 überwiegend auf die beiden anderen Hebel, auf Verstärkungslernen und Reasoning.
Seit 2026 meldet sich das Pre-Training-Scaling zurück. Anthropic-Chef Dario Amodei bekräftigt seit Jahren, die Skalierungsgesetze seien nie an eine Wand gestoßen, und Branchendienste berichteten im August 2026, OpenAI bereite unter dem internen Namen „Doug" den größten Pre-Training-Lauf seiner Firmengeschichte vor. Offiziell bestätigt ist das bislang nicht.
Wie ernst die Anbieter die Gesetzmäßigkeit nehmen, zeigen ihre Investitionen. Der Rechenaufwand für Spitzenmodelle wächst laut dem Forschungsinstitut Epoch AI um das Vier- bis Fünffache pro Jahr. Das Training von GPT-4 kostete nach Angaben von Sam Altman mehr als 100 Millionen Dollar, und mit dem Projekt Stargate planen OpenAI, Oracle und SoftBank KI-Rechenzentren für 500 Milliarden Dollar.
Bei alledem bleibt wichtig, dass Scaling Laws Beobachtungen sind und keine Naturgesetze. Sie beschreiben bisherige Messreihen und garantieren nicht, dass die Kurve endlos weiterläuft. Als größte praktische Bremsen gelten knappe hochwertige Trainingsdaten und der Strombedarf der Rechenzentren.
Scaling Laws sind kein Werkzeug, das ein Betrieb direkt einsetzt. Ihr praktischer Wert liegt darin, KI-Nachrichten und Preisentwicklungen richtig einzuordnen und daraus bessere Kaufentscheidungen abzuleiten.
Am deutlichsten spüren Firmen die Gesetzmäßigkeit beim Preis. Während das Training der Spitzenmodelle immer teurer wird, fällt der Preis für die Nutzung rasant. Der Stanford AI Index beziffert den Preisverfall für Leistung auf dem Niveau von GPT-3.5 auf mehr als das 280-Fache innerhalb von rund zwei Jahren. Für Ihre Planung heißt das, dass eine KI-Funktion, die heute nur im teuren Premium-Abo steckt, oft schon ein oder zwei Jahre später zum günstigen Standard gehört. Sich lange an heutige Preise und Modelle zu binden, lohnt deshalb selten. Einen aktuellen Preisvergleich der großen Anbieter finden Sie im Artikel Claude vs ChatGPT 2026.
Auch eine Alltagsbeobachtung erklärt sich über die Skalierungs-Hebel. Wenn ChatGPT, Claude oder Gemini im Denkmodus spürbar länger brauchen, erleben Sie Test-Time-Scaling in Aktion. Die bessere Antwort wird schlicht mit mehr Rechenzeit erkauft, die der Anbieter bezahlen muss. Für Routineaufgaben wie E-Mails oder kurze Angebotstexte reicht darum fast immer das schnelle Standardmodell.
Und wer Schlagzeilen über Milliarden-Rechenzentren, Chip-Engpässe oder neue Kraftwerke für KI verstehen will, hat mit den Scaling Laws den Schlüssel in der Hand. Hinter all diesen Meldungen steckt dieselbe Wette der Anbieter, dass mehr Rechenleistung auch in den kommenden Jahren planbar bessere Modelle liefert.