Zum Hauptinhalt springen
Cloud / Google Cloud / Produkte / Managed Service for Apache Spark - Spark und Hadoop Cluster

Managed Service for Apache Spark - Spark und Hadoop Cluster

Managed Service for Apache Spark (ehemals Dataproc) ist Googles verwalteter Service für Apache Spark und Hadoop mit Cluster- und Serverless-Option.

Data Analytics
Preismodell Bezahlung nach Nutzung (Compute-Engine-Ressourcen plus geringer Management-Aufschlag pro vCPU-Stunde)
Verfügbarkeit Global mit EU-Regionen
Datensouveränität EU-Regionen verfügbar
Zuverlässigkeit SLA gemäß Anbieter (siehe offizielle SLA-Seite) SLA

Managed Service for Apache Spark (ehemals Dataproc) ermöglicht die schnelle Bereitstellung von Apache-Spark- und Hadoop-Workloads für Big-Data-Anwendungen.

Was ist Managed Service for Apache Spark?

Managed Service for Apache Spark ist die seit April 2026 gültige Sammelmarke für Googles verwaltete Spark-Angebote: die clusterbasierte Variante (vormals Dataproc on Compute Engine) und die serverlose Variante (vormals Google Cloud Serverless for Apache Spark). Der Service unterstützt Apache Spark, Hadoop, Presto und weitere Open-Source-Tools. API-Endpunkte, Client-Bibliotheken, CLI-Befehle und IAM-Rollennamen tragen weiterhin den Namen Dataproc, sodass bestehende Automatisierungen unverändert funktionieren.

Kernfunktionen

  • Schnelle Bereitstellung: Cluster mit vorkonfigurierten Images zügig einsatzbereit
  • Serverless-Option: Spark-Jobs ohne Cluster-Management mit automatischer Skalierung
  • Native GCP-Integration: Direkte Verbindung zu BigQuery, Cloud Storage und der Gemini Enterprise Agent Platform (ehemals Vertex AI)
  • Autoscaling: Automatische Anpassung der Cluster-Größe basierend auf Workload, bis hin zur Skalierung auf null Worker-Knoten
  • Spot-VM-Unterstützung: Kosteneinsparung durch präemptive Instanzen für geeignete Workloads

Typische Anwendungsfälle

ETL und Datenverarbeitung

Migration bestehender Hadoop- oder Spark-ETL-Pipelines in die Cloud mit minimalen Code-Änderungen. Der Service unterstützt gängige Spark-APIs und Bibliotheken.

Data Lake Analytics

Analyse großer Datenmengen in Cloud Storage mit Spark SQL oder Presto. Direkte Integration mit BigQuery ermöglicht hybride Analysen über Data Lake und Data Warehouse.

Machine Learning mit Spark MLlib

Training von ML-Modellen auf großen Datensätzen mit Spark MLlib. Integration mit der Gemini Enterprise Agent Platform für Model Deployment und Monitoring.

Vorteile

  • Open-Source-Kompatibilität: Unveränderte Spark-, Hadoop- und Presto-Workloads ausführen
  • Kosteneffizienz: Nutzungsbasierte Abrechnung und Spot-VMs für temporäre Workloads
  • Schnelle Migration: Bestehende On-Premises-Workloads ohne größeres Refactoring migrieren
  • Flexible Optionen: Wahl zwischen Cluster-basiert und Serverless je nach Anforderung

Integration mit innFactory

Als zertifizierter Google Cloud Partner unterstützt innFactory Sie beim Managed Service for Apache Spark: Migration von On-Premises-Hadoop-Clustern, Optimierung bestehender Spark-Jobs, Architektur von Data-Lake-Analytics-Lösungen und Kostenoptimierung durch passende Cluster-Konfiguration.

Verfügbare Varianten & Optionen

Managed Service for Apache Spark serverless

Stärken
  • Kein Cluster-Management
  • Automatische Ressourcenskalierung
  • Schneller Start ohne Cluster-Provisionierung
Einschränkungen
  • Weniger Konfigurationsoptionen

Typische Anwendungsfälle

Batch-Verarbeitung mit Spark
ETL-Pipelines
Data Lake Analytics
Machine Learning Training

Technische Spezifikationen

API REST API, gcloud CLI, Client Libraries
Integration BigQuery, Cloud Storage, Pub/Sub, Gemini Enterprise Agent Platform (ehemals Vertex AI)
Security VPC Service Controls, CMEK, Kerberos

Häufig gestellte Fragen

Was ist Managed Service for Apache Spark (ehemals Dataproc)?

Managed Service for Apache Spark ist Googles vereinheitlichte Marke für verwaltete Spark-Workloads, sowohl clusterbasiert (früher Dataproc on Compute Engine) als auch serverlos (früher Google Cloud Serverless for Apache Spark). API, Client-Bibliotheken, CLI und IAM-Namen bleiben unverändert Dataproc.

Was ist der Unterschied zwischen Managed Service for Apache Spark und Dataflow?

Managed Service for Apache Spark ist für bestehende Spark/Hadoop-Workloads optimiert, während Dataflow ein vollständig serverloser Service für Apache-Beam-Pipelines ist. Für Migrationen von On-Premises-Hadoop-Clustern ist der Managed Service for Apache Spark meist die bessere Wahl.

Kann ich bestehende Spark-Jobs ohne Änderungen ausführen?

Ja, der Service ist kompatibel mit Apache Spark, Hadoop, Hive, Pig und Presto. Bestehende Jobs lassen sich in der Regel ohne größere Code-Änderungen migrieren.

Wie wird Managed Service for Apache Spark abgerechnet?

Abgerechnet werden die genutzten Compute-Engine-Ressourcen sowie ein geringer Management-Aufschlag pro vCPU-Stunde für den Cluster-Betrieb. Spot-VMs können die Kosten für geeignete Workloads deutlich reduzieren; für exakte Werte ist die aktuelle Preisseite maßgeblich.

Ist der Service DSGVO-konform?

Ja, der Managed Service for Apache Spark ist in EU-Regionen verfügbar. Daten können mit Customer-Managed Encryption Keys (CMEK) verschlüsselt werden, was DSGVO-Anforderungen unterstützt.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.

Google Cloud Partner

innFactory ist zertifizierter Google Cloud Partner. Wir bieten Beratung, Implementierung und Managed Services.

Google Cloud Partner

Ähnliche Produkte anderer Cloud-Anbieter

Andere Cloud-Anbieter bieten vergleichbare Services in dieser Kategorie. Als Multi-Cloud Partner helfen wir bei der richtigen Wahl.

AWS

Amazon Athena - Serverless SQL-Abfragen

Amazon Athena führt SQL-Abfragen direkt auf Daten in S3 aus. Serverless, ohne Infrastruktur-Setup, Pay-per-Query.

Preismodell Pay-per-Query (Preis pro TB gescannter …
SLA 99,9% Verfügbarkeit gemäß Amazon Athena SLA
Vergleichen →
AWS

Amazon Data Firehose - Echtzeit-Datenlieferung

Amazon Data Firehose ist ein AWS-Service für die zuverlässige Echtzeit-Lieferung von Streaming-Daten an Datenspeicher.

Preismodell Bezahlung pro GB data ingested
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon DataZone - Daten-Governance und Katalog

Amazon DataZone ist ein AWS-Service für Daten-Governance, Katalogisierung und sichere Datenfreigabe im Unternehmen.

Preismodell Pay-as-you-go: API-Anfragen, …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon EMR - Big Data Processing

Amazon EMR ist eine verwaltete Big-Data-Plattform für Apache Spark, Hadoop und andere Frameworks.

Preismodell Bezahlung für EC2 instances plus EMR …
SLA Abhängig von EC2 SLA
Vergleichen →
AWS

Amazon Kinesis - AWS Data Streaming für Real-Time Analytics

Amazon Kinesis ist die AWS-Service-Familie für Echtzeit-Datenstreaming, Log-Processing und Analytics.

Preismodell Provisioned: pro Shard-Stunde plus …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Amazon Kinesis Data Streams - Echtzeit-Datenstreaming

Amazon Kinesis Data Streams ist ein AWS-Service für skalierbares Echtzeit-Datenstreaming mit geringer Latenz.

Preismodell Pay-per-use: On-Demand pro GB …
SLA 99,9% Verfügbarkeit
Vergleichen →

41 vergleichbare Produkte bei anderen Cloud-Anbietern gefunden.

Bereit, mit Managed Service for Apache Spark - Spark und Hadoop Cluster zu starten?

Unsere zertifizierten Google Cloud Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren