Managed Service for Apache Spark (ehemals Dataproc) ermöglicht die schnelle Bereitstellung von Apache-Spark- und Hadoop-Workloads für Big-Data-Anwendungen.
Was ist Managed Service for Apache Spark?
Managed Service for Apache Spark ist die seit April 2026 gültige Sammelmarke für Googles verwaltete Spark-Angebote: die clusterbasierte Variante (vormals Dataproc on Compute Engine) und die serverlose Variante (vormals Google Cloud Serverless for Apache Spark). Der Service unterstützt Apache Spark, Hadoop, Presto und weitere Open-Source-Tools. API-Endpunkte, Client-Bibliotheken, CLI-Befehle und IAM-Rollennamen tragen weiterhin den Namen Dataproc, sodass bestehende Automatisierungen unverändert funktionieren.
Kernfunktionen
- Schnelle Bereitstellung: Cluster mit vorkonfigurierten Images zügig einsatzbereit
- Serverless-Option: Spark-Jobs ohne Cluster-Management mit automatischer Skalierung
- Native GCP-Integration: Direkte Verbindung zu BigQuery, Cloud Storage und der Gemini Enterprise Agent Platform (ehemals Vertex AI)
- Autoscaling: Automatische Anpassung der Cluster-Größe basierend auf Workload, bis hin zur Skalierung auf null Worker-Knoten
- Spot-VM-Unterstützung: Kosteneinsparung durch präemptive Instanzen für geeignete Workloads
Typische Anwendungsfälle
ETL und Datenverarbeitung
Migration bestehender Hadoop- oder Spark-ETL-Pipelines in die Cloud mit minimalen Code-Änderungen. Der Service unterstützt gängige Spark-APIs und Bibliotheken.
Data Lake Analytics
Analyse großer Datenmengen in Cloud Storage mit Spark SQL oder Presto. Direkte Integration mit BigQuery ermöglicht hybride Analysen über Data Lake und Data Warehouse.
Machine Learning mit Spark MLlib
Training von ML-Modellen auf großen Datensätzen mit Spark MLlib. Integration mit der Gemini Enterprise Agent Platform für Model Deployment und Monitoring.
Vorteile
- Open-Source-Kompatibilität: Unveränderte Spark-, Hadoop- und Presto-Workloads ausführen
- Kosteneffizienz: Nutzungsbasierte Abrechnung und Spot-VMs für temporäre Workloads
- Schnelle Migration: Bestehende On-Premises-Workloads ohne größeres Refactoring migrieren
- Flexible Optionen: Wahl zwischen Cluster-basiert und Serverless je nach Anforderung
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie beim Managed Service for Apache Spark: Migration von On-Premises-Hadoop-Clustern, Optimierung bestehender Spark-Jobs, Architektur von Data-Lake-Analytics-Lösungen und Kostenoptimierung durch passende Cluster-Konfiguration.
Verfügbare Varianten & Optionen
Managed Service for Apache Spark auf Clustern
- Volle Kontrolle über Cluster-Konfiguration
- Spot-VMs für Kostenoptimierung
- Autoscaling-Unterstützung, inklusive Skalierung auf null Worker-Knoten
- Cluster-Management erforderlich
Managed Service for Apache Spark serverless
- Kein Cluster-Management
- Automatische Ressourcenskalierung
- Schneller Start ohne Cluster-Provisionierung
- Weniger Konfigurationsoptionen
Typische Anwendungsfälle
Technische Spezifikationen
Häufig gestellte Fragen
Was ist Managed Service for Apache Spark (ehemals Dataproc)?
Managed Service for Apache Spark ist Googles vereinheitlichte Marke für verwaltete Spark-Workloads, sowohl clusterbasiert (früher Dataproc on Compute Engine) als auch serverlos (früher Google Cloud Serverless for Apache Spark). API, Client-Bibliotheken, CLI und IAM-Namen bleiben unverändert Dataproc.
Was ist der Unterschied zwischen Managed Service for Apache Spark und Dataflow?
Managed Service for Apache Spark ist für bestehende Spark/Hadoop-Workloads optimiert, während Dataflow ein vollständig serverloser Service für Apache-Beam-Pipelines ist. Für Migrationen von On-Premises-Hadoop-Clustern ist der Managed Service for Apache Spark meist die bessere Wahl.
Kann ich bestehende Spark-Jobs ohne Änderungen ausführen?
Ja, der Service ist kompatibel mit Apache Spark, Hadoop, Hive, Pig und Presto. Bestehende Jobs lassen sich in der Regel ohne größere Code-Änderungen migrieren.
Wie wird Managed Service for Apache Spark abgerechnet?
Abgerechnet werden die genutzten Compute-Engine-Ressourcen sowie ein geringer Management-Aufschlag pro vCPU-Stunde für den Cluster-Betrieb. Spot-VMs können die Kosten für geeignete Workloads deutlich reduzieren; für exakte Werte ist die aktuelle Preisseite maßgeblich.
Ist der Service DSGVO-konform?
Ja, der Managed Service for Apache Spark ist in EU-Regionen verfügbar. Daten können mit Customer-Managed Encryption Keys (CMEK) verschlüsselt werden, was DSGVO-Anforderungen unterstützt.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
