Dataflow ist Googles serverloser Service für Stream- und Batch-Datenverarbeitung. Ein Code für beide Modelle, automatisches Scaling ohne Cluster-Management.
Was ist Dataflow?
Dataflow führt Apache-Beam-Pipelines auf Googles Infrastruktur aus. Sie schreiben Pipelines in Java, Python oder Go, Dataflow übernimmt Provisioning, Scaling und Monitoring. Derselbe Code läuft für Streaming (Echtzeit) und Batch (historische Daten).
Anders als bei Hadoop/Spark-Clustern ist Dataflow serverless: keine Cluster-Konfiguration, automatisches Scaling, Pay-per-Use.
Streaming vs. Batch
Streaming Pipeline (Echtzeit):
Pub/Sub → Dataflow → BigQuery
(kontinuierlich)
Batch Pipeline (periodisch):
Cloud Storage → Dataflow → BigQuery
(täglich, stündlich)Apache Beam ermöglicht denselben Code für beide Modi. Wechseln Sie von Batch zu Streaming durch Ändern der Pipeline-Konfiguration.
Kernfunktionen
- Unified Model: Ein SDK für Streaming und Batch
- Autoscaling: Automatisches Hinzufügen/Entfernen von Workern
- Exactly-Once: Garantierte Verarbeitung ohne Duplikate
- Windowing: Zeit-basierte Aggregationen (Tumbling, Sliding, Session)
- Watermarks: Handling von verspäteten Events
Typische Anwendungsfälle
Real-time Analytics
Events aus Pub/Sub in Echtzeit aggregieren und nach BigQuery schreiben. Dashboards zeigen Metriken mit sehr geringer Latenz.
ETL Pipelines
Daten aus Cloud Storage lesen, transformieren, bereinigen und nach BigQuery laden. Scheduled Jobs für tägliche/stündliche Verarbeitung.
Pub/Sub zu BigQuery
Streaming Ingestion von Events zu BigQuery. Dataflow Templates ermöglichen Deployment ohne Code.
Event-Driven ML
Feature-Berechnung in Echtzeit für ML-Modelle. Dataflow berechnet Features, die Modelle laufen über die Gemini Enterprise Agent Platform (ehemals Vertex AI) oder die Gemini API.
Dataflow vs. Dataproc vs. Data Fusion
| Kriterium | Dataflow | Dataproc | Data Fusion |
|---|---|---|---|
| Modell | Serverless | Managed Cluster | Visual ETL |
| SDK | Apache Beam | Spark, Hadoop | GUI, CDAP |
| Scaling | Automatisch | Manuell/Autoscaling | Automatisch |
| Use Case | Neue Pipelines | Bestehende Spark-Jobs | No-Code ETL |
| Kosten | Pay-per-Use | Pay-per-Cluster | Pay-per-Hour |
Vorteile
- Serverless: Kein Cluster-Management
- Unified: Streaming und Batch mit einem SDK
- Portabel: Apache Beam läuft auch auf anderen Runnern
- Integriert: Native GCP-Connectoren für zentrale Services
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei Dataflow: Pipeline-Entwicklung, Migration von Spark zu Beam, Performance-Optimierung und Kostenanalyse.
Typische Anwendungsfälle
Technische Spezifikationen
Häufig gestellte Fragen
Was ist Dataflow?
Dataflow ist ein vollständig verwalteter Service für Datenverarbeitung, der sowohl Streaming als auch Batch mit dem gleichen Code unterstützt. Er basiert auf Apache Beam und skaliert automatisch basierend auf dem Workload.
Was ist der Unterschied zwischen Dataflow und Data Fusion?
Dataflow ist für Entwickler, die Apache-Beam-Pipelines in Java, Python oder Go schreiben. Data Fusion ist für Business-Analysten mit visueller Drag-and-Drop-Oberfläche ohne Code. Für komplexe, code-basierte Pipelines nutzen Sie Dataflow.
Wann sollte ich Dataflow statt Dataproc nutzen?
Dataflow ist serverless mit automatischem Scaling, ideal für Pipelines ohne Cluster-Management. Dataproc (heute Teil des Managed Service for Apache Spark bzw. Hadoop-Angebots) eignet sich, wenn Sie bestehende Spark-Jobs betreiben oder Cluster-Kontrolle benötigen. Für neue Projekte empfehlen wir häufig Dataflow.
Wie funktioniert Autoscaling bei Dataflow?
Dataflow skaliert automatisch basierend auf dem Backlog (unverarbeitete Nachrichten). Bei Streaming-Pipelines werden Worker hinzugefügt, wenn der Backlog wächst. Sie können Min-/Max-Worker und den Scaling-Algorithmus konfigurieren.
Was kostet Dataflow?
Dataflow berechnet die genutzte vCPU-Zeit, RAM (GB-Stunden) und Persistent Disk nach aktuellem Google-Cloud-Preisblatt; Streaming ist in der Regel teurer als Batch. Flexible Resource Scheduling (FlexRS) bietet für zeitlich flexible Batch-Jobs einen einheitlichen Rabatt von rund 40 % auf vCPU- und Speicherkosten.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
