Glossareintrag
Wir denken. KI tippt mit.
Fine-Tuning (deutsch Feinabstimmung, auch Feintuning oder Nachtraining) bezeichnet das nachträgliche Weitertrainieren eines fertigen KI-Modells mit eigenen Beispieldaten. Ein Large Language Model (LLM) wie GPT, Gemini oder Llama wird dabei nicht neu gebaut, sondern mit einigen Dutzend bis einigen Tausend Eingabe-Antwort-Paaren weitertrainiert, bis es eine Spezialaufgabe, ein festes Ausgabeformat oder einen gewünschten Tonfall zuverlässig beherrscht. Anders als beim Prompting verändert Fine-Tuning die inneren Parameter, also das Modell selbst. Das Ergebnis ist eine eigene, dauerhaft angepasste Modellversion.
Zur Einordnung hilft der Blick auf die Nachbarbegriffe. Im Pre-Training lernt das Modell aus riesigen Mengen an Trainingsdaten sein gesamtes Sprach- und Weltwissen, das ist die teure Grundausbildung durch den Hersteller. Prompts und RAG (Retrieval-Augmented Generation, das Mitliefern eigener Dokumente) steuern das fertige Modell dagegen nur von außen, ohne es zu verändern. Das Lernen allein aus Beispielen im Prompt heißt In-Context-Learning. Fine-Tuning liegt dazwischen, es baut auf dem vortrainierten Modell auf und passt es fest an.
Ein verbreitetes Missverständnis lässt sich gleich ausräumen. Fine-Tuning ist nicht der Weg, einem Modell aktuelles Firmenwissen beizubringen, dafür sind RAG und Wissensdatenbanken gedacht. Fine-Tuning verändert Verhalten, Stil und Format der Antworten, nicht das Faktenwissen.
Der Ablauf ist bei allen Anbietern ähnlich. Sie sammeln Beispielpaare aus Eingabe und gewünschter Antwort, laden sie als strukturierte Datei hoch (üblich ist das JSONL-Format), starten einen Trainingslauf und prüfen anschließend, ob das angepasste Modell wirklich besser antwortet als das Original mit einem guten Prompt. OpenAI empfiehlt, mit rund 50 sorgfältig erstellten Beispielen zu starten, spürbare Verbesserungen zeigen sich meist ab 50 bis 100 Beispielen. Google rät bei Gemini dazu, mit etwa 100 Beispielen zu beginnen. Bei beiden gilt, dass Qualität die Menge schlägt.
Hinter dem Sammelbegriff stecken mehrere Verfahren:
Der Markt hat sich 2025 und 2026 spürbar gedreht. OpenAI stellt seine Selbstbedienungs-Plattform für Fine-Tuning schrittweise ein, seit Mai 2026 werden keine neuen Kunden mehr angenommen, ab Januar 2027 sind auch für Bestandskunden keine neuen Trainingsläufe mehr möglich (bereits trainierte Modelle laufen weiter, bis das jeweilige Basismodell abgeschaltet wird). Google hat das einfache Tuning im AI Studio bereits im Mai 2025 eingestellt und bietet Fine-Tuning nur noch über die Unternehmensplattform Vertex AI an, dort unter anderem für die Gemini-2.5-Modelle. Anthropic bietet für Claude über die eigene API gar kein Fine-Tuning an, einzig das ältere Claude 3 Haiku lässt sich über Amazon Bedrock anpassen.
Wer im August 2026 neu einsteigt, landet deshalb fast zwangsläufig bei Cloud-Plattformen wie Vertex AI und Amazon Bedrock oder bei offenen Modellen über Dienste wie Together AI, Fireworks AI oder Hugging Face. Beide großen Anbieter begründen den Rückzug gleich, denn moderne Modelle mit gutem Prompting und RAG machen ein eigenes Training in den meisten Fällen überflüssig.
Die reinen Trainingskosten sind überraschend klein. Ein Rechenbeispiel zur Größenordnung, gerechnet mit Googles offiziellen Preisen für die Gemini-2.0-Modelle (Stand August 2026): 3.000 Trainingsbeispiele mit je rund 500 Tokens ergeben 1,5 Millionen Trainings-Tokens. Bei drei Trainingsdurchläufen und einem Preis von 1 US-Dollar pro Million Tokens (Gemini 2.0 Flash-Lite auf Vertex AI) kostet der komplette Lauf rund 4,50 US-Dollar, beim größeren Gemini 2.0 Flash mit 3 US-Dollar pro Million etwa 13,50 US-Dollar. Anbieter für offene Modelle verlangen für LoRA-Training teils unter einem US-Dollar pro Million Tokens. Der eigentliche Kostenblock ist die Datenarbeit, denn hunderte saubere, fachlich geprüfte Beispielpaare zu erstellen kostet Arbeitstage bis Wochen.
Wo Fine-Tuning richtig eingesetzt wird, sind die Effekte messbar und gut dokumentiert. Der Telekommunikationskonzern SK Telecom steigerte mit einem feinabgestimmten Claude 3 Haiku die positiven Bewertungen seiner Kundenservice-Antworten um 73 Prozent. In einem Anthropic-Test zur Inhalts-Klassifikation stieg die Genauigkeit durch Fine-Tuning von 81,5 auf 99,6 Prozent. Das Biomedizin-Unternehmen NextNet schrumpfte seinen Prompt von 2.000 auf 200 Tokens und senkte die Kosten pro Anfrage um 90 Prozent, weil die Anweisungen nach dem Training im Modell selbst steckten. Google nennt in einer Auswertung von Tuning-Projekten hunderter Organisationen als häufigste Motive Genauigkeit, festes Ausgabeformat, Fachsprache, Kostensenkung und weniger Halluzinationen.
Den Vorteilen stehen handfeste Risiken gegenüber:
Für lokale Unternehmen und Handwerksbetriebe ist Fine-Tuning im Jahr 2026 in fast allen Fällen das falsche Werkzeug, und diese ehrliche Einordnung ist der wichtigste Praxisnutzen des Begriffs. Die Anbieter sagen das selbst. OpenAI empfiehlt in seiner Doku, zuerst Prompting auszureizen, und Google verweist Einsteiger auf gutes Prompting und eigene Dokumente, bevor überhaupt ein Training startet. Die einfachen Selbstbedienungswege sind seit 2025 und 2026 ohnehin geschlossen oder in Unternehmens-Cloud-Plattformen gewandert.
Für die Praxis gilt eine einfache Reihenfolge. Erst Prompting, dann eigene Dokumente per RAG, und erst wenn beides bei hohem Volumen nachweislich nicht reicht, ist Fine-Tuning einen Blick wert.