Was ist Parallelstore?
Parallelstore ist ein verwaltetes, paralleles Hochleistungs-Dateisystem von Google Cloud. Es richtet sich an High Performance Computing sowie an KI- und ML-Workloads, die hohe IOPS und hohen Durchsatz bei niedriger Latenz erfordern. Das parallele Dateisystem erlaubt gleichzeitigen Zugriff vieler Clients auf dieselben Daten.
Hinweis zum Produktstatus: Der Zugang zu Parallelstore erfolgt derzeit nur über Allowlisting nach Rücksprache mit dem Google-Cloud-Vertrieb. Google positioniert daneben Google Cloud Managed Lustre als neues First-Party-Lustre-Dateisystem für HPC- und KI-Workloads. Nach aktuellem Kenntnisstand ist ein Auslaufen von Parallelstore zugunsten von Managed Lustre angekündigt bzw. absehbar. Wer eine neue Storage-Architektur für parallele Workloads plant, sollte Managed Lustre als Alternative prüfen und bei innFactory oder direkt bei Google Cloud den aktuellen Stand erfragen.
Klassische Speicheroptionen werden bei datenintensivem Training und Simulationen oft zum Engpass, weil GPUs und CPUs auf Daten warten. Parallelstore adressiert dieses Problem mit hohem aggregierten Durchsatz und niedriger Latenz. Das System basiert auf lokalen SSDs mit Erasure Coding und ist damit als schneller Scratch-Speicher für temporäre Workloads konzipiert, nicht als dauerhafter Primärspeicher.
Kernfunktionen
- Hoher Durchsatz und IOPS: Laut Anbieter skaliert die Performance pro TiB, mit mehreren GiBps Durchsatz und mehreren Zehntausend IOPS je nach provisionierter Kapazität.
- Niedrige Latenz und Parallelität: Unterstützung für mehrere Tausend gleichzeitige Client-Prozesse bei niedriger Latenz für kleine Zugriffe.
- POSIX-Kompatibilität und Integration: Das Dateisystem ist POSIX-konform und lässt sich über einen CSI-Treiber an Compute Engine VMs und Google Kubernetes Engine (GKE) einbinden.
- Schneller Cloud-Storage-Transfer: Batch-Datentransfer zu und von Cloud Storage mit hohem Durchsatz.
Typische Anwendungsfälle
KI- und ML-Training: Beim Training großer Modelle müssen umfangreiche Datensätze schnell und parallel an viele Beschleuniger geliefert werden. Parallelstore reduziert Wartezeiten der GPUs und verkürzt dadurch die Trainingsdauer.
High Performance Computing: Simulationen und wissenschaftliche Berechnungen erfordern gleichzeitigen Zugriff vieler Knoten auf gemeinsame Daten. Das parallele Dateisystem liefert den dafür nötigen aggregierten Durchsatz mit niedriger Latenz.
Scratch-Speicher für Batch-Jobs: Rechenintensive Pipelines nutzen Parallelstore als schnellen Zwischenspeicher. Daten lassen sich mit hoher Geschwindigkeit aus Cloud Storage laden, verarbeiten und Ergebnisse zurückschreiben.
Vorteile
- Hoher Durchsatz und IOPS für datenintensive HPC- und KI-/ML-Workloads
- Kürzere Trainings- und Berechnungszeiten durch reduzierte Wartezeiten der Beschleuniger
- Integration in Compute Engine und GKE über einen CSI-Treiber
- Verfügbarkeit in EU-Regionen für Anforderungen an Datenresidenz
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei der Bewertung von Parallelstore gegenüber Alternativen wie Managed Lustre sowie bei Einführung und Betrieb paralleler Dateisysteme für HPC- und KI-Workloads.
Typische Anwendungsfälle
Häufig gestellte Fragen
Was ist Parallelstore?
Parallelstore ist ein verwaltetes, paralleles Hochleistungs-Dateisystem von Google Cloud für High Performance Computing sowie KI- und ML-Workloads mit hohem Durchsatz und niedriger Latenz. Das System ist POSIX-kompatibel und unterstützt gleichzeitigen Multi-Client-Zugriff. Der Zugang erfolgt aktuell nur über Allowlisting nach Rücksprache mit dem Google-Cloud-Vertrieb.
Wird Parallelstore eingestellt?
Nach aktuellem Kenntnisstand plant Google, Parallelstore zugunsten von Google Cloud Managed Lustre, dem neuen First-Party-Lustre-Dateisystem, auslaufen zu lassen. Für neue Projekte empfiehlt sich eine Prüfung von Managed Lustre als Nachfolgelösung; bestehende Nutzer sollten den offiziellen Ankündigungs- und Migrationszeitplan von Google Cloud prüfen.
Wann sollte ich Parallelstore einsetzen?
Parallelstore eignet sich für KI-/ML-Training und -Inferenz, HPC-Simulationen und rechenintensive Batch-Jobs, bei denen viele Clients gleichzeitig auf dieselben Daten zugreifen. Da das System auf lokalen SSDs mit Erasure Coding basiert, ist es für temporäre Scratch-Daten ausgelegt und nicht als dauerhafter Primärspeicher gedacht.
Was kostet Parallelstore?
Parallelstore wird nach provisionierter Kapazität abgerechnet, nicht nach genutztem Speicher. Die genauen Preise pro Region finden Sie auf der offiziellen Pricing-Seite von Google Cloud.
Welchen Durchsatz und welche Kapazität bietet Parallelstore?
Die nutzbare Kapazität reicht laut Anbieter von 12 TiB bis 100 TiB, mit pro TiB skalierender Performance (rund 1,15 GiBps Lese- und 0,5 GiBps Schreibdurchsatz, ca. 30.000 Lese- und 10.000 Schreib-IOPS). Es werden bis zu 4.000 gleichzeitige Client-Prozesse unterstützt. Aktuelle Werte siehe offizielle Dokumentation.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
