Zum Hauptinhalt springen
Cloud / Google Cloud / Produkte / Managed Service for Apache Spark - Serverlose Spark-Ausführung

Managed Service for Apache Spark - Serverlose Spark-Ausführung

Managed Service for Apache Spark (vormals Dataproc Serverless) führt Spark-Jobs ohne Cluster-Management auf Google Cloud aus.

Data Analytics
Preismodell Bezahlung nach Nutzung (per DCU-Stunde)
Verfügbarkeit Global mit EU-Regionen
Datensouveränität EU-Regionen verfügbar
Zuverlässigkeit SLA gemäß Anbieter (siehe offizielle SLA-Seite) SLA

Was ist Managed Service for Apache Spark?

Managed Service for Apache Spark ist der aktuelle Produktname für den Google-Cloud-Dienst rund um Apache Spark, der die früheren Angebote Dataproc on Compute Engine (Cluster-Bereitstellung) und Google Cloud Serverless for Apache Spark (serverlose Bereitstellung) unter einer gemeinsamen Marke zusammenführt. Für serverlose Workloads reichen Sie Ihren Spark-Code ein, die Plattform provisioniert automatisch die benötigten Ressourcen, führt den Job aus und gibt die Ressourcen anschließend wieder frei.

Im Gegensatz zum klassischen Cluster-Betrieb entfällt im serverlosen Modus die Notwendigkeit, Cluster zu provisionieren, zu konfigurieren und dauerhaft zu verwalten. Die Abrechnung erfolgt ausschließlich für die Dauer der tatsächlichen Job-Ausführung.

Kernfunktionen

  • Zwei Betriebsmodi: Cluster-Modus (verwaltete Dataproc-Cluster auf Compute Engine) und serverloser Modus (ohne eigene Cluster-Verwaltung)
  • Kein Cluster-Management im serverlosen Modus: Spark-Batch-Workloads ohne Provisionierung eigener Cluster
  • Automatische Skalierung: Ressourcenanpassung während der Job-Ausführung je nach Bedarf
  • Open-Source-Kompatibilität: Unterstützung gängiger Open-Source-Datentools für Batch-Verarbeitung, Abfragen, Streaming und Machine Learning
  • Integration mit dem Google-Cloud-Datenökosystem, etwa BigQuery und Cloud Storage

Typische Anwendungsfälle

Ad-hoc-Datenanalyse

Data Scientists und Analysten nutzen den serverlosen Modus für explorative Analysen mit Spark, ohne Cluster provisionieren oder verwalten zu müssen.

Geplante ETL-Pipelines

Regelmäßig ausgeführte Spark-ETL-Jobs profitieren vom serverlosen Modus, da zwischen den Ausführungen keine Cluster vorgehalten werden müssen. Orchestrierungs-Tools lassen sich für die Ablaufsteuerung anbinden.

Workloads mit dauerhaftem Cluster-Bedarf

Für Workloads mit konstant hoher Auslastung oder speziellen Cluster-Konfigurationen bleibt der Cluster-Modus auf Compute Engine eine Option innerhalb desselben Dienstes.

Vorteile

  • Kein Infrastrukturmanagement oder Cluster-Tuning im serverlosen Betrieb
  • Schnellere Iterationszyklen für Data Engineers
  • Kosteneffizient: Abrechnung nach tatsächlicher Nutzung
  • Flexibilität durch Wahl zwischen Cluster- und serverlosem Modus im selben Dienst

Integration mit innFactory

Als zertifizierter Google Cloud Partner unterstützt innFactory Sie beim Einsatz von Managed Service for Apache Spark: Migration bestehender Spark-Jobs, Architektur von Datenpipelines und Kostenoptimierung zwischen Cluster- und serverlosem Betrieb.

Typische Anwendungsfälle

Serverlose Spark-Jobs
Ad-hoc-Datenanalyse
ETL-Pipelines

Häufig gestellte Fragen

Was ist Managed Service for Apache Spark?

Managed Service for Apache Spark ist der aktuelle Name für den Google-Cloud-Dienst, der zuvor als Dataproc Serverless for Apache Spark (serverloser Modus) sowie als Dataproc on Compute Engine (Cluster-Modus) bekannt war. Er ermöglicht die Ausführung von Apache-Spark-Jobs ohne eigene Cluster-Provisionierung, die Plattform übernimmt die Infrastruktur automatisch.

Was ist der Unterschied zwischen serverlosem Modus und Cluster-Modus?

Im Cluster-Modus provisionieren und konfigurieren Sie eigene Dataproc-Cluster auf Compute Engine. Im serverlosen Modus reichen Sie nur den Spark-Code ein, die Plattform übernimmt Provisionierung, Skalierung und Freigabe der Ressourcen automatisch.

Wie wird der serverlose Modus abgerechnet?

Die Abrechnung im serverlosen Modus erfolgt nutzungsbasiert pro Dataproc Compute Unit (DCU) Stunde. Kosten fallen nur während der tatsächlichen Ausführungszeit der Workload an, nicht für Leerlaufzeiten.

Für welche Workloads eignet sich der Dienst?

Der Dienst eignet sich für Batch-Verarbeitung, Abfragen, Streaming und Machine-Learning-Workloads mit Open-Source-Datentools auf Basis von Apache Spark, insbesondere wenn kein dauerhaftes Cluster-Management gewünscht ist.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.

Google Cloud Partner

innFactory ist zertifizierter Google Cloud Partner. Wir bieten Beratung, Implementierung und Managed Services.

Google Cloud Partner

Bereit, mit Managed Service for Apache Spark - Serverlose Spark-Ausführung zu starten?

Unsere zertifizierten Google Cloud Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren