Glossareintrag
Wir denken. KI tippt mit.
Computer Vision (deutsch maschinelles Sehen oder Bildverstehen) ist das Teilgebiet der Künstlichen Intelligenz, das es PCs möglich macht, Bilder und Videos zu analysieren und die Inhalte zu verstehen. Die Bilderkennung (Image Recognition) ordnet ein Bild einer Kategorie zu, z. B. „Rechnung“ oder „Badezimmer“. Die Objekterkennung (Object Detection) geht weiter und findet einzelne Objekte samt ihrer Position im Bild, z. B. jede Steckdose auf einem Baustellenfoto.
Computer Vision analysiert vorhandene Aufnahmen und ist damit das Gegenstück zur generativen KI, die neue Bilder erzeugt. In der Industrie heißt es meist Machine Vision oder industrielle Bildverarbeitung, z. B. bei Prüfkameras am Fließband. Technische Basis sind heute fast immer Deep Learning und neuronale Netze, die das Erkennen aus Millionen von Beispielbildern lernen.
Bis 2012 mussten Entwickler einem Bildprogramm von Hand beibringen, woran es Kanten, Formen und Muster erkennt. Den Durchbruch brachte 2012 das neuronale Netz AlexNet. Es senkte die Fehlerquote im ImageNet-Wettbewerb, dem damals wichtigsten Bilderkennungs-Vergleich, auf 15,3 Prozent (Überblick zu den ImageNet-Meilensteinen). Der Zweitplatzierte lag bei 26,2 Prozent. 2015 fiel die Fehlerquote unter den menschlichen Vergleichswert von rund 5,1 Prozent, Ende desselben Jahres erreichte Microsofts ResNet 3,57 Prozent (ResNet-Forschungsarbeit). Seit 2021 verarbeiten Vision Transformer Bilder mit derselben Technik, mit der Sprachmodelle Texte verarbeiten. Sie zerlegen ein Foto in kleine Kacheln und lesen es wie eine Wortfolge (Google-Forschungsarbeit zum Vision Transformer).
Typische Aufgaben:
Im Alltag übernehmen diese Aufgaben zunehmend multimodale KI-Modelle. Wer ein Foto in ChatGPT, Gemini oder Claude hochlädt und Fragen dazu stellt, nutzt Computer Vision, ohne den Begriff je zu lesen. Spezialisierte Modelle bleiben überall dort im Einsatz, wo Tempo und Präzision zählen. Die YOLO-Familie von Ultralytics erkennt Objekte in Echtzeit auch auf kleiner Hardware. Metas Segment Anything (SAM 3) stellt Objekte in Bild und Video auf Zuruf frei, z. B. auf den Text-Befehl „gelber Schulbus“. Die freie Programmbibliothek OpenCV bildet seit über 20 Jahren das Fundament vieler Anwendungen. Wie Sprachmodelle können auch Vision-Modelle halluzinieren und Details beschreiben, die im Bild gar nicht vorkommen.
Computer Vision kann inzwischen deutlich mehr als Bilder und Objekte erkennen. Gemini wertet komplette Videos samt Tonspur aus und beantwortet Fragen dazu mit Zeitstempel (offizielle Video-Dokumentation von Google). Dokumenten-KI wie Google Document AI liest Rechnungen und Formulare aus und übergibt Rechnungsnummer, Beträge und Positionen an die Buchhaltung. Live-Assistenten wie Gemini Live beantworten Fragen zu dem, was die Smartphone-Kamera gerade filmt, und Datenbrillen wie die Ray-Ban-Meta-Modelle beschreiben auf Zuruf das Blickfeld ihres Trägers. KI-Agenten mit Computer Use bedienen ganze Programme, indem sie Bildschirmfotos auswerten und daraus Maus- und Tastatureingaben ableiten; Claude steuert auf diesem Weg seit 2024 PCs. Aus Fotoserien entstehen per Fotogrammetrie 3D-Modelle, Metas SAM 3D rekonstruiert Objekte sogar aus einem einzigen Bild. In Robotern und autonomen Autos ist die Kamera der wichtigste Sensor, ein Waymo-Robotaxi der sechsten Generation fährt mit 13 Kameras, 4 Lidar- und 6 Radarsensoren.
Auch Staat und Regierung setzen die Technik ein. In Rheinland-Pfalz erkennt das Kamerasystem MonoCam Autofahrer mit Handy am Steuer. Jeden Treffer prüfen anschließend zwei Polizeibeamte nach (ZDF-Bericht zur MonoCam). Zugleich zieht der EU AI Act Grenzen. Seit Februar 2025 sind unter anderem biometrische Echtzeit-Gesichtserkennung im öffentlichen Raum (mit engen Ausnahmen für die Strafverfolgung) und Emotionserkennung am Arbeitsplatz und in Bildungseinrichtungen verboten (Artikel 5 der KI-Verordnung). Für Kameras im eigenen Betrieb gilt zusätzlich die DSGVO. Aufnahmen von Personen benötigen eine Rechtsgrundlage und kurze Löschfristen (Überblick des Bundesdatenschutzbeauftragten).
In der Medizin liefert die Technik messbar bessere Ergebnisse. Die deutsche PRAIM-Studie mit über 460.000 Teilnehmerinnen zeigte, dass KI-gestützte Mammographie-Befundung 17,6 Prozent mehr Brustkrebsfälle entdeckt, ohne mehr Fehlalarme auszulösen (Mitteilung der Universität zu Lübeck).
Handwerksbetriebe und Unternehmen nutzen Computer Vision heute primär über die Kamera am Handy. Dachdecker lassen Dächer per Drohne vermessen. Der Berliner Anbieter Airteam errechnet aus rund 75 Drohnenfotos binnen 24 Stunden ein maßhaltiges 3D-Dachmodell samt Aufmaß, nach Anbieterangaben bis zu 90 Prozent schneller als das Aufmaß von Hand. Für Innenräume erstellt die App magicplan Grundrisse direkt aus dem Kamera- oder LiDAR-Scan des Smartphones, und Togal.AI liest PDF-Baupläne aus und ermittelt Flächen und Massen für die Kalkulation.
Auf der Baustelle ordnen Systeme wie OpenSpace die Aufnahmen einer 360-Grad-Helmkamera automatisch dem Grundriss zu und dokumentieren so den Baufortschritt. Drohnendienste fotografieren Fassaden und lassen die KI Risse, Abplatzungen und Korrosion markieren.
Kfz-Betriebe und Gutachter beschleunigen die Schadenaufnahme. FastTrackAI der Deutschen Automobil Treuhand (DAT) analysiert Schadenfotos in Sekunden, klassifiziert die Schäden und schätzt die Reparaturkosten.
Auch kleine Produktionsbetriebe prüfen Qualität per Kamera. Die Pforzheimer Galvanik C. Jentner erkennt mit einem KI-Bildprüfsystem feinste Kratzer und Dellen auf beschichteten Bauteilen und senkt so Ausschuss und Materialverbrauch (Praxisbeispiel des Green-AI Hub Mittelstand). Die sächsische Großbäckerei Emil Reimann lässt eine KI Röntgenbilder auswerten, die selbst kleinste Fremdkörper in Backwaren findet (Bericht der Lebensmittel Praxis).
Für lokale Unternehmen zählt außerdem Google Lens. Wer eine Ladenfassade fotografiert, bekommt Öffnungszeiten, Bewertungen und Angebote aus dem Google-Unternehmensprofil angezeigt. Ein gepflegtes Profil wird damit auch über die Kamera gefunden. Im Verkaufsraum zählen 3D-Sensoren Kunden anonym über Höhenprofile, ganz ohne Gesichter zu speichern.
Ausprobieren lässt sich das alles kostenlos. Fotografieren Sie die Fehlermeldung einer Heizungsanlage und lassen Sie sich den Fehlercode in ChatGPT oder Gemini erklären. Die Fotoüberweisung der Sparkassen-App überträgt abfotografierte Rechnungen direkt ins Überweisungsformular. Die Pflanzen-App Flora Incognita der TU Ilmenau bestimmt Pflanzen per Foto. Und mit Googles Teachable Machine trainieren Sie im Browser ohne eine Zeile Code ein eigenes Bilderkennungsmodell, z. B. um zwei Bauteil-Typen auseinanderzuhalten.