Was ist Dataproc Metastore?
Dataproc Metastore ist ein vollständig verwalteter, hochverfügbarer Hive Metastore Service von Google Cloud. Der Service fungiert als zentrales Metadaten-Repository für Data-Lake-Workloads und speichert Tabellendefinitionen, Schemata und Partitionsinformationen, auf die verschiedene Compute-Engines zugreifen.
Ohne verwalteten Metastore müssen Cluster eigene Metadaten-Datenbanken betreiben, die bei Cluster-Löschung verloren gehen. Dataproc Metastore entkoppelt die Metadaten vom Compute und ermöglicht so ephemere Cluster ohne Datenverlust. Er lässt sich sowohl mit dem Managed Service for Apache Spark (ehemals Dataproc, inklusive serverloser Variante) als auch mit selbstverwalteten Clustern verbinden.
Kernfunktionen
- Verwalteter Hive Metastore: Vollständig verwalteter Service ohne Infrastrukturmanagement
- Multi-Engine-Zugriff: Gemeinsame Metadaten für Spark, Presto, Hive und weitere Engines
- Hochverfügbarkeit: Automatische Replikation und Failover, je nach Service-Tier auch Multi-Zone
- IAM-Integration: Feingranulare Zugriffssteuerung auf Metadaten
Typische Anwendungsfälle
Data-Lake-Architektur
In Data-Lake-Architekturen auf Cloud Storage dient Dataproc Metastore als zentrales Schema-Repository. Verschiedene Teams und Tools greifen auf die gleichen Tabellendefinitionen zu.
Ephemere Cluster-Workflows
Data-Engineering-Teams erstellen Cluster für einzelne Jobs über den Managed Service for Apache Spark und löschen sie danach. Der zentrale Metastore bewahrt die Tabellendefinitionen unabhängig vom Cluster-Lebenszyklus.
Vorteile
- Keine Metastore-Infrastruktur zu verwalten
- Metadaten überleben den Cluster-Lebenszyklus
- Konsistente Schemadefinitionen über Teams und Tools
- Integration mit BigQuery für Lakehouse-Architekturen
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei Dataproc Metastore: Data-Lake-Architektur, Metadatenmanagement und Lakehouse-Strategien.
Typische Anwendungsfälle
Häufig gestellte Fragen
Was ist Dataproc Metastore?
Dataproc Metastore ist ein vollständig verwalteter Hive Metastore Service von Google Cloud. Er speichert und verwaltet Metadaten für Data-Lake-Workloads, sodass Spark, Presto und Hive auf gemeinsame Tabellendefinitionen zugreifen können.
Warum brauche ich einen zentralen Metastore?
Ohne zentralen Metastore muss jeder Cluster eigene Metadaten verwalten. Ein zentraler Metastore ermöglicht, dass mehrere Cluster und Services auf die gleichen Tabellendefinitionen zugreifen, was Konsistenz und Wiederverwendbarkeit verbessert.
Welche Tools arbeiten mit Dataproc Metastore?
Dataproc Metastore ist kompatibel mit Apache Spark, Presto, Apache Hive, dem Managed Service for Apache Spark (ehemals Dataproc, inklusive der serverlosen Variante) und weiteren Tools, die das Hive-Metastore-Interface nutzen.
Welche Service-Tiers gibt es bei Dataproc Metastore?
Google Cloud bietet unter anderem Standard-, Enterprise- und Enterprise-Plus-Tiers an, die sich in Skalierbarkeit, Ausfallsicherheit und Multi-Zone-Hochverfügbarkeit unterscheiden. Für die genauen Preise je Tier ist die aktuelle Preisseite maßgeblich.
Was kostet Dataproc Metastore?
Die Abrechnung erfolgt stundenbasiert pro Metastore-Service, wobei der genaue Preis vom gewählten Service-Tier abhängt. Für eine verbindliche Kalkulation ist die aktuelle Preisseite von Google Cloud heranzuziehen.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
