Die Video Intelligence API analysiert Videos automatisch und extrahiert strukturierte Metadaten für Media-Workflows, Content Discovery und Moderation.
Was ist die Video Intelligence API?
Die Video Intelligence API ist Googles vortrainierter Service zur automatischen Videoanalyse, häufig auch unter dem Namen “Video AI” bezeichnet. Der Service erkennt Objekte, Szenen, Aktionen, Text und explizite Inhalte in gespeicherten oder live-gestreamten Videos und liefert strukturierte Metadaten mit Zeitstempeln auf Video-, Segment-, Shot- und Frame-Ebene.
Im Gegensatz zu manueller Video-Kategorisierung analysiert die API große Mengen an Content in kurzer Zeit. Sie identifiziert eine Vielzahl von Objekten und Konzepten und liefert zu jeder Erkennung Zeitstempel und Confidence Scores.
Für spezialisierte Anforderungen steht AutoML Video zur Verfügung. Damit lassen sich Custom-Modelle für eigene Objektklassen oder Klassifikationen trainieren, etwa für spezifische Produktkategorien oder branchenspezifische Inhalte. Die frühere Celebrity-Recognition-Funktion der API gilt als veraltet; für neue Projekte sollte darauf verzichtet werden.
Kernfunktionen
- Label Detection: Automatische Erkennung von Objekten, Orten und Aktivitäten im Video mit Zeitstempeln.
- Shot Change Detection: Erkennung von Kamera- und Schnittwechseln zur automatischen Segmentierung.
- Explicit-Content-Erkennung: Automatische Prüfung auf potenziell unangemessene Inhalte.
- Speech Transcription: Transkription gesprochener Inhalte für Untertitel und Suche.
- Texterkennung (OCR) und Logo Detection: Erkennung von Text und Marken-/Firmenlogos im Bild.
- Object Tracking und Person Detection: Verfolgung von Objekten und Personen über den Videoverlauf hinweg.
Typische Anwendungsfälle
Content Moderation für Plattformen
Eine Video-Plattform nutzt die Explicit-Content-Erkennung, um hochgeladene Videos automatisch zu prüfen. Problematische Inhalte werden vor Veröffentlichung geflaggt. Das Moderation-Team fokussiert sich auf die markierten Segmente statt auf manuelle Vollsichtung.
Video-Katalogisierung und Suche
Ein Medienunternehmen indexiert sein Videoarchiv. Label Detection erkennt Objekte, Szenen und Aktivitäten. Redakteure finden relevante Clips durch Suche nach Begriffen wie “Interview im Büro” oder “Sportszene im Freien”.
Automatische Untertitelung
Ein E-Learning-Anbieter nutzt Speech Transcription für automatische Untertitel. Die API transkribiert gesprochene Inhalte mit Zeitstempeln. Das spart manuelle Transkription und verbessert die Barrierefreiheit.
Logo-Tracking in Broadcasts
Ein Sponsor-Tracking-Dienstleister analysiert Sportübertragungen auf Logo-Sichtbarkeit. Logo Detection misst, wie oft und wie lange Sponsor-Logos im Bild erscheinen.
Shot-basierte Videosegmentierung
Eine Postproduktionsfirma nutzt Shot Change Detection zur automatischen Schnitterkennung. Die API identifiziert Kamerawechsel und liefert damit die Basis für weitere Bearbeitungsschritte wie Color Grading.
Vorteile
- Schnelle Integration: Vortrainierte Modelle liefern ohne eigenes ML-Know-how sofort nutzbare Ergebnisse.
- Breiter Funktionsumfang: Von Objekterkennung über Transkription bis Logo-Erkennung in einer API.
- Skalierbarkeit: Verarbeitung großer Videomengen ohne eigene Infrastruktur.
- Erweiterbarkeit: AutoML Video ermöglicht Custom-Modelle für spezielle Anforderungen.
- Google-Cloud-Integration: Native Anbindung an Cloud Storage und andere Google-Cloud-Dienste.
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei der Integration der Video Intelligence API in Ihre Media-Workflows: von der Architektur über die Implementierung bis zur Optimierung.
Kontaktieren Sie uns für eine Beratung.
Verfügbare Varianten & Optionen
Video Intelligence API
- Vortrainierte Modelle
- Keine ML-Expertise erforderlich
- Schnelle Integration
- Begrenzte Anpassbarkeit
AutoML Video
- Custom-Modelle trainierbar
- Eigene Objektklassen
- Höhere Genauigkeit
- Erfordert Trainingsdaten
Typische Anwendungsfälle
Technische Spezifikationen
Häufig gestellte Fragen
Was ist die Video Intelligence API?
Die Video Intelligence API (oft auch als "Video AI" bezeichnet) analysiert Videos automatisch und extrahiert Metadaten. Der Service erkennt Objekte, Szenen, Text und explizite Inhalte. Für Custom-Anforderungen steht AutoML Video zur Verfügung.
Welche Analysefunktionen bietet die Video Intelligence API?
Die API bietet unter anderem Label Detection (Objekte/Aktionen), Shot Change Detection, Explicit-Content-Erkennung, Speech Transcription, Texterkennung (OCR), Logo Detection, Object Tracking und Person Detection. Die Celebrity-Recognition-Funktion gilt inzwischen als veraltet und sollte nicht mehr für neue Projekte genutzt werden.
Wie funktioniert die Abrechnung?
Die Video Intelligence API rechnet pro analysierter Minute ab, mit einem monatlichen Freikontingent je Feature. Die Kosten pro Minute unterscheiden sich je nach Feature und danach, ob Stored-Video- oder Streaming-Analyse genutzt wird. Aktuelle Preise finden Sie auf der offiziellen Pricing-Seite.
Kann ich eigene Erkennungsmodelle trainieren?
Ja, mit AutoML Video lassen sich Custom-Modelle für Objekterkennung und Klassifikation trainieren. Dafür werden gelabelte Trainingsdaten für die gewünschten Klassen benötigt.
Ist die Video Intelligence API für Live-Streaming geeignet?
Die API unterstützt neben der Batch-Verarbeitung gespeicherter Videos auch eine Streaming-Annotation für Live-Inhalte, allerdings mit einem eingeschränkteren Feature-Umfang und anderen Kosten als bei der Stored-Video-Analyse.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
