Zum Hauptinhalt springen
Cloud / Google Cloud / Produkte / Dataflow - Managed Stream und Batch Processing

Dataflow - Managed Stream und Batch Processing

Dataflow ist Googles vollständig verwalteter Service für Stream- und Batch-Datenverarbeitung. Basiert auf Apache Beam, skaliert automatisch.

Data Analytics
Preismodell Bezahlung nach Nutzung (vCPU-Stunden, RAM-GB-Stunden, Persistent Disk)
Verfügbarkeit Global mit EU-Regionen
Datensouveränität EU-Regionen verfügbar
Zuverlässigkeit SLA gemäß Anbieter (siehe offizielle SLA-Seite) SLA

Dataflow ist Googles serverloser Service für Stream- und Batch-Datenverarbeitung. Ein Code für beide Modelle, automatisches Scaling ohne Cluster-Management.

Was ist Dataflow?

Dataflow führt Apache-Beam-Pipelines auf Googles Infrastruktur aus. Sie schreiben Pipelines in Java, Python oder Go, Dataflow übernimmt Provisioning, Scaling und Monitoring. Derselbe Code läuft für Streaming (Echtzeit) und Batch (historische Daten).

Anders als bei Hadoop/Spark-Clustern ist Dataflow serverless: keine Cluster-Konfiguration, automatisches Scaling, Pay-per-Use.

Streaming vs. Batch

Streaming Pipeline (Echtzeit):
Pub/Sub → Dataflow → BigQuery
         (kontinuierlich)

Batch Pipeline (periodisch):
Cloud Storage → Dataflow → BigQuery
                (täglich, stündlich)

Apache Beam ermöglicht denselben Code für beide Modi. Wechseln Sie von Batch zu Streaming durch Ändern der Pipeline-Konfiguration.

Kernfunktionen

  • Unified Model: Ein SDK für Streaming und Batch
  • Autoscaling: Automatisches Hinzufügen/Entfernen von Workern
  • Exactly-Once: Garantierte Verarbeitung ohne Duplikate
  • Windowing: Zeit-basierte Aggregationen (Tumbling, Sliding, Session)
  • Watermarks: Handling von verspäteten Events

Typische Anwendungsfälle

Real-time Analytics

Events aus Pub/Sub in Echtzeit aggregieren und nach BigQuery schreiben. Dashboards zeigen Metriken mit sehr geringer Latenz.

ETL Pipelines

Daten aus Cloud Storage lesen, transformieren, bereinigen und nach BigQuery laden. Scheduled Jobs für tägliche/stündliche Verarbeitung.

Pub/Sub zu BigQuery

Streaming Ingestion von Events zu BigQuery. Dataflow Templates ermöglichen Deployment ohne Code.

Event-Driven ML

Feature-Berechnung in Echtzeit für ML-Modelle. Dataflow berechnet Features, die Modelle laufen über die Gemini Enterprise Agent Platform (ehemals Vertex AI) oder die Gemini API.

Dataflow vs. Dataproc vs. Data Fusion

KriteriumDataflowDataprocData Fusion
ModellServerlessManaged ClusterVisual ETL
SDKApache BeamSpark, HadoopGUI, CDAP
ScalingAutomatischManuell/AutoscalingAutomatisch
Use CaseNeue PipelinesBestehende Spark-JobsNo-Code ETL
KostenPay-per-UsePay-per-ClusterPay-per-Hour

Vorteile

  • Serverless: Kein Cluster-Management
  • Unified: Streaming und Batch mit einem SDK
  • Portabel: Apache Beam läuft auch auf anderen Runnern
  • Integriert: Native GCP-Connectoren für zentrale Services

Integration mit innFactory

Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei Dataflow: Pipeline-Entwicklung, Migration von Spark zu Beam, Performance-Optimierung und Kostenanalyse.

Typische Anwendungsfälle

Real-time Streaming Pipelines
ETL und Batch Processing
Pub/Sub zu BigQuery Ingestion
Event-Driven Analytics

Technische Spezifikationen

Scaling Autoscaling basierend auf Backlog
Sdk Apache Beam (Java, Python, Go)
Sinks BigQuery, Bigtable, Cloud Storage, Pub/Sub
Sources Pub/Sub, Cloud Storage, BigQuery, Kafka

Häufig gestellte Fragen

Was ist Dataflow?

Dataflow ist ein vollständig verwalteter Service für Datenverarbeitung, der sowohl Streaming als auch Batch mit dem gleichen Code unterstützt. Er basiert auf Apache Beam und skaliert automatisch basierend auf dem Workload.

Was ist der Unterschied zwischen Dataflow und Data Fusion?

Dataflow ist für Entwickler, die Apache-Beam-Pipelines in Java, Python oder Go schreiben. Data Fusion ist für Business-Analysten mit visueller Drag-and-Drop-Oberfläche ohne Code. Für komplexe, code-basierte Pipelines nutzen Sie Dataflow.

Wann sollte ich Dataflow statt Dataproc nutzen?

Dataflow ist serverless mit automatischem Scaling, ideal für Pipelines ohne Cluster-Management. Dataproc (heute Teil des Managed Service for Apache Spark bzw. Hadoop-Angebots) eignet sich, wenn Sie bestehende Spark-Jobs betreiben oder Cluster-Kontrolle benötigen. Für neue Projekte empfehlen wir häufig Dataflow.

Wie funktioniert Autoscaling bei Dataflow?

Dataflow skaliert automatisch basierend auf dem Backlog (unverarbeitete Nachrichten). Bei Streaming-Pipelines werden Worker hinzugefügt, wenn der Backlog wächst. Sie können Min-/Max-Worker und den Scaling-Algorithmus konfigurieren.

Was kostet Dataflow?

Dataflow berechnet die genutzte vCPU-Zeit, RAM (GB-Stunden) und Persistent Disk nach aktuellem Google-Cloud-Preisblatt; Streaming ist in der Regel teurer als Batch. Flexible Resource Scheduling (FlexRS) bietet für zeitlich flexible Batch-Jobs einen einheitlichen Rabatt von rund 40 % auf vCPU- und Speicherkosten.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.

Google Cloud Partner

innFactory ist zertifizierter Google Cloud Partner. Wir bieten Beratung, Implementierung und Managed Services.

Google Cloud Partner

Ähnliche Produkte anderer Cloud-Anbieter

Andere Cloud-Anbieter bieten vergleichbare Services in dieser Kategorie. Als Multi-Cloud Partner helfen wir bei der richtigen Wahl.

AWS

Amazon Athena - Serverless SQL-Abfragen

Amazon Athena führt SQL-Abfragen direkt auf Daten in S3 aus. Serverless, ohne Infrastruktur-Setup, Pay-per-Query.

Preismodell Pay-per-Query (Preis pro TB gescannter …
SLA 99,9% Verfügbarkeit gemäß Amazon Athena SLA
Vergleichen →
AWS

Amazon Data Firehose - Echtzeit-Datenlieferung

Amazon Data Firehose ist ein AWS-Service für die zuverlässige Echtzeit-Lieferung von Streaming-Daten an Datenspeicher.

Preismodell Bezahlung pro GB data ingested
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon DataZone - Daten-Governance und Katalog

Amazon DataZone ist ein AWS-Service für Daten-Governance, Katalogisierung und sichere Datenfreigabe im Unternehmen.

Preismodell Pay-as-you-go: API-Anfragen, …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon EMR - Big Data Processing

Amazon EMR ist eine verwaltete Big-Data-Plattform für Apache Spark, Hadoop und andere Frameworks.

Preismodell Bezahlung für EC2 instances plus EMR …
SLA Abhängig von EC2 SLA
Vergleichen →
AWS

Amazon Kinesis - AWS Data Streaming für Real-Time Analytics

Amazon Kinesis ist die AWS-Service-Familie für Echtzeit-Datenstreaming, Log-Processing und Analytics.

Preismodell Provisioned: pro Shard-Stunde plus …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon Kinesis Data Streams - Echtzeit-Datenstreaming

Amazon Kinesis Data Streams ist ein AWS-Service für skalierbares Echtzeit-Datenstreaming mit geringer Latenz.

Preismodell Pay-per-use: On-Demand pro GB …
SLA 99,9% Verfügbarkeit
Vergleichen →

41 vergleichbare Produkte bei anderen Cloud-Anbietern gefunden.

Bereit, mit Dataflow - Managed Stream und Batch Processing zu starten?

Unsere zertifizierten Google Cloud Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren