Computer Vision

KI-Glossar

KI-Fachgebiet, das sich mit dem maschinellen Erkennen, Analysieren und Interpretieren von Bildern und Videos befasst.

Kurzdefinition

Computer Vision ist ein Teilgebiet der Künstlichen Intelligenz, das Computern ermöglicht, visuelle Informationen wie Fotos, Videos oder Live-Kamerabilder zu verarbeiten, zu analysieren und zu interpretieren.

Einfach erklärt

Menschen erkennen auf einem Foto sofort, was darauf zu sehen ist. Für einen Computer ist ein Bild zunächst nur ein Raster von Farbwerten. Computer Vision umfasst alle Methoden, mit denen Maschinen dieses Raster inhaltlich deuten: Objekte und Personen erkennen, Texte lesen, Defekte auf Produkten identifizieren oder Bewegungen analysieren.

Anwendungen sind heute in vielen Branchen Standard: Qualitätskontrolle in der Fertigung, Gesichtserkennung in Sicherheitssystemen, automatisches Lesen von Dokumenten, medizinische Bildanalyse oder Fahrerassistenz in Fahrzeugen. Mit multimodalen Sprachmodellen wie GPT-4o oder Claude kann Computer Vision nun auch direkt in KI-Assistenten integriert werden.

Beispiel aus dem Arbeitsalltag

Ein Hersteller von Verpackungsmaterial setzt eine Kamera am Produktionsband ein, die jedes fertige Stück fotografiert. Ein Computer-Vision-Modell analysiert die Bilder in Echtzeit und meldet Abweichungen von der Norm, etwa Risse oder Farbfehler. Fehlerhafte Stücke werden automatisch ausgeschleust, ohne dass Mitarbeitende jedes Stück prüfen müssen.

Warum ist der Begriff wichtig?

Computer Vision erweitert den Einsatzbereich von KI deutlich über Texte hinaus. Für Unternehmen mit physischen Produkten, Sicherheitsanforderungen oder dokumentenintensiven Prozessen ist das Fachgebiet besonders relevant.

Mit der Verbreitung multimodaler Sprachmodelle wird Computer Vision auch für Wissensarbeiter zugänglich: Bilder hochladen, analysieren lassen und Ergebnisse in natürlicher Sprache erhalten, das ist heute ohne technisches Know-how möglich.

Chancen

  • Visuelle Qualitätskontrolle ohne manuelle Sichtprüfung
  • Automatisches Auslesen von Formularen, Rechnungen und Dokumenten
  • Analyse von Videoaufnahmen für Sicherheit oder Prozessoptimierung
  • Integration in multimodale KI-Assistenten für breite Nutzung

Risiken und typische Fehler

  • Datenschutzfragen bei Personenabbildungen und Überwachung
  • Modelle reagieren empfindlich auf Bildqualität, Lichtverhältnisse und Kamerawinkel
  • Fehlerhafte Erkennungen können in kritischen Prozessen gravierende Folgen haben
  • Regulatorische Anforderungen bei Sicherheits- und Hochrisikoanwendungen

Verwandte Begriffe

Passende Inhalte im KI College