Glossareintrag

Was bedeutet
Multimodale KI (Multimodalität, Multimodal AI)?

Veröffentlicht: 14/08/2026
Aktualisiert: 05/09/2026

Wir denken. KI tippt mit.

Multimodale KI (Multimodalität, Multimodal AI)

Definition:

Multimodale KI (englisch multimodal AI) bezeichnet Künstliche Intelligenz, die mehrere Arten von Daten versteht, neben Text also auch Bilder, Audio oder Video. Jede dieser Datenarten heißt in der Fachsprache Modalität, die Fähigkeit selbst nennt man Multimodalität. Ein multimodales Modell beantwortet zum Beispiel Fragen zu einem hochgeladenen Foto, liest ein PDF-Dokument aus oder führt ein gesprochenes Gespräch.

Das Gegenstück ist unimodale KI. Die ersten großen Sprachmodelle (LLMs) konnten ausschließlich Text lesen und schreiben. Inzwischen ist Multimodalität der Normalfall, praktisch jedes aktuelle KI-Modell von Anthropic, OpenAI oder Google versteht mindestens Text und Bilder.

Beschreibung:

Multimodale Modelle übersetzen alle Eingaben in dieselbe interne Sprache. Ein Bild wird dafür in kleine Blöcke zerlegt, die das Modell wie Wörter verarbeitet. Anthropic macht das für Claude öffentlich nachvollziehbar, dort ist ein Block 28 mal 28 Pixel groß, ein Foto mit 1.000 mal 1.000 Pixeln kostet dadurch rund 1.300 Token. Bilder sind für die Modelle also spürbar „teurer" als Text. Video behandeln sie als Bildfolge mit Tonspur, Google Gemini tastet Videos standardmäßig mit einem Bild pro Sekunde ab, eine Sekunde Video kostet damit rund 300 Token.

Wichtig ist der Unterschied zwischen nativ multimodalen Modellen und zusammengeschalteten Einzelmodellen. Nativ multimodal heißt, dass ein Modell von Beginn an gemeinsam auf mehreren Datenarten trainiert wurde. Meta beschreibt dieses Verfahren in der Ankündigung der Llama-4-Modellfamilie als „Early Fusion", Text- und Bild-Bausteine laufen dort durch dieselben Verarbeitungsschichten. Beim älteren Baukasten-Ansatz reichen sich dagegen mehrere Spezialmodelle ihre Ergebnisse zu, etwa eine Spracherkennung, ein Sprachmodell und eine Sprachausgabe. Das funktioniert, verliert aber an jeder Übergabestelle Information, zum Beispiel den Tonfall eines Anrufers.

Multimodal bei der Eingabe ist außerdem nicht dasselbe wie multimodal bei der Ausgabe. Claude nimmt Bilder und PDF-Dokumente entgegen, antwortet aber ausschließlich mit Text und kann selbst keine Bilder erzeugen. Die ChatGPT-Modelle der GPT-5.6-Familie verstehen Text und Bilder, gesprochene Unterhaltungen laufen bei OpenAI über das eigene Sprachmodell GPT-Live. Die größte Spannweite deckt Stand August 2026 Google Gemini ab, dessen aktuelle Flash-Modelle nehmen Text, Bilder, Audio und Video entgegen und geben Text, Bilder und Audio aus. Solche Modelle heißen Omni- oder Any-to-any-Modelle.

Auch offen verfügbare Modelle sind multimodal geworden. Metas Llama 4 war im April 2025 die erste offene, nativ multimodale Modellfamilie, Alibabas Qwen3-Omni versteht sogar Video und antwortet in Echtzeit mit gesprochener Sprache.

Die Grenzen der Bildverarbeitung dokumentieren die Anbieter selbst recht offen. In der Vision-Dokumentation von Anthropic stehen unter anderem diese Punkte, die sinngemäß für alle multimodalen Modelle gelten:

  • Objekte auf Bildern werden nur ungefähr gezählt, besonders bei vielen kleinen Gegenständen
  • Positionen und Größen sind Schätzungen, keine Messwerte
  • bei unscharfen, gedrehten oder sehr kleinen Bildern steigt die Gefahr von Fehldeutungen, das Modell kann Bildinhalte regelrecht halluzinieren
  • sehr kleine Schrift kann beim automatischen Verkleinern großer Bilder unlesbar werden
  • ob ein Bild KI-generiert ist, erkennen die Modelle nicht zuverlässig
  • Personen auf Fotos identifizieren die Modelle aus Datenschutzgründen nicht

Multimodale KI (Multimodalität, Multimodal AI) für Unternehmen und Handwerker:

Für Handwerksbetriebe und lokale Unternehmen ist Multimodalität der Punkt, an dem KI wirklich alltagstauglich wird, denn der Betriebsalltag besteht aus Fotos, Plänen, Zetteln und Gesprächen, nicht aus getipptem Text.

Am meisten bringt im Alltag die Bildeingabe. Ein Handyfoto vom tropfenden Siphon, von der rissigen Silikonfuge oder vom Sicherungskasten reicht, und die KI liefert eine erste Einschätzung, formuliert die Antwort an den Kunden oder erstellt eine vorläufige Materialliste. Genauso lassen sich Lieferscheine, Typenschilder und handgeschriebene Aufmaßzettel abfotografieren und in saubere Tabellen oder Texte verwandeln. Bei gut lesbarer Handschrift klappt das meist ordentlich, die Kontrolle der übernommenen Zahlen bleibt aber Pflicht.

Sprachein- und -ausgabe machen die KI unterwegs nutzbar. Wer auf der Rückfahrt von der Baustelle eine Sprachnotiz diktiert, bekommt daraus eine fertige Kunden-E-Mail, einen Angebotsentwurf oder eine Aufgabenliste fürs Büro. ChatGPT, Gemini und Claude bieten Sprachmodi in ihren Apps an, in den Grundfunktionen auch kostenlos.

Auch technische Unterlagen sind ein Fall für multimodale KI. Das Datenblatt der Wärmepumpe, der Fehlercode im Display oder der Grundriss aus der Ausschreibung lassen sich abfotografieren, die Frage dazu stellen Sie direkt im selben Chat.

Drei Einschränkungen sollten Sie kennen. Verbindliche Maße gehören weiterhin aufs Aufmaß, denn aus Fotos schätzt die KI Größen nur grob. Fotos, auf denen Kunden oder Mitarbeiter erkennbar sind, gehören ohne Einwilligung nicht in ein KI-Tool, hier gelten die Regeln für personenbezogene Daten. Und jede Ausgabe braucht einen fachkundigen Blick, bevor sie zum Kunden geht.

Automation Intelligence im Handwerk - Glossareintrag
Lexikon für künstliche Intelligenz und Automation - Glossar für Handwerker und Handwerksbetriebe
Handwerk transformieren durch Artificial Intelligence und Automation Intelligence

Webinar Release KI im Handwerk

Sie haben eine Frage?