↓ Zum Hauptinhalt springen
Cloud / Google Cloud / Produkte / Cluster Toolkit - Open-Source-Blueprints für HPC- und KI-Cluster

Cluster Toolkit - Open-Source-Blueprints für HPC- und KI-Cluster

Cluster Toolkit vereinfacht die Bereitstellung von HPC-, KI- und ML-Clustern auf Google Cloud mit anpassbaren, quelloffenen Blueprints.

Compute
Preismodell Cluster Toolkit selbst ist ein kostenfreies Open-Source-Tool; Kosten entstehen für die damit bereitgestellten Google-Cloud-Ressourcen (z. B. Compute Engine, GKE)
Verfügbarkeit Weltweit über alle Google-Cloud-Regionen, in denen die verwendeten Zielressourcen verfügbar sind
Datensouveränität Richtet sich nach den Regionen der über das Toolkit bereitgestellten Google-Cloud-Ressourcen; keine gesonderte Souveränitätsaussage auf der Übersichtsseite
Zuverlässigkeit SLA gemäß Anbieter je bereitgestelltem Google-Cloud-Dienst (siehe offizielle SLA-Seite) SLA

Cluster Toolkit ist Googles quelloffenes Werkzeug, um HPC-, KI- und ML-Cluster auf Google Cloud reproduzierbar und nach Best Practices bereitzustellen. Statt Infrastruktur manuell zusammenzustellen, definieren Teams ihre Cluster-Architektur in einem YAML-Blueprint und lassen daraus automatisch Terraform- und Packer-Konfigurationen erzeugen.

Was ist Cluster Toolkit?

Laut offizieller Dokumentation vereinfacht Cluster Toolkit die Bereitstellung von High-Performance-Computing-(HPC)-, KI- und ML-Workloads auf Google Cloud. Das quelloffene Tool stellt anpassbare Blueprints bereit, die helfen, Infrastruktur nach Google-Cloud-Best-Practices zu provisionieren; das Toolkit lässt sich außerdem für eine breite Palette an Bereitstellungsanforderungen anpassen und erweitern.

Komponenten

Cluster Toolkit besteht laut Dokumentation aus vier Bausteinen:

  • Cluster-Blueprint: Eine YAML-Datei, die die Architektur des Clusters festlegt, indem sie definiert, welche Module verwendet und wie diese konfiguriert werden.
  • Module: Wiederverwendbare, konfigurierbare Bausteine für spezifische Ressourcen wie Scheduler, Storage oder Compute-Knoten.
  • Das gcluster-Tool: Ein Kommandozeilen-Werkzeug, das Blueprint und Module zu einem Deployment-Ordner kompiliert.
  • Deployment-Ordner: Ein generiertes Verzeichnis mit den für die Bereitstellung nötigen Terraform- und Packer-Konfigurationen. Dieser Ordner kann direkt verwendet oder vor der Bereitstellung weiter angepasst werden.

Funktionsweise

Nutzerinnen und Nutzer richten zunächst ihre Umgebung über Cloud Shell oder ein lokales Linux-/macOS-Terminal ein, klonen das Cluster-Toolkit-Repository und erstellen mithilfe von Beispiel-Blueprints eine eigene Blueprint-Datei. Der Befehl gcluster create erzeugt daraus einen Deployment-Ordner mit den nötigen Terraform- und Packer-Konfigurationen; die anschließend bereitgestellten gcluster-Befehle übernehmen die eigentliche Bereitstellung des Clusters auf Google Cloud. Nach der Bereitstellung lassen sich Jobs auf dem HPC-Cluster einreichen und die genutzten Google-Cloud-Ressourcen über Cloud Monitoring analysieren.

Für laufende Cluster unterstützt Cluster Toolkit laut Dokumentation Aktualisierungen bestimmter Konfigurationen, etwa die Größenänderung einer Slurm-Partition oder die Aktualisierung eines GKE-Node-Pools. Für grundlegende architektonische Änderungen, etwa einen VPC-Wechsel oder eine andere Scheduler-Wahl, ist dagegen eine vollständige Neubereitstellung des Clusters erforderlich.

Telemetrie

Google sammelt standardmäßig nicht personenbezogene Nutzungsstatistiken zu Cluster Toolkit, etwa verwendete Befehle, Exit-Codes, Ausführungsdauer, Namen von Standard-Blueprints und -Modulen, Maschinentypen sowie die verwendete Toolkit-Version. Diese Telemetrie lässt sich über den Befehl gcluster telemetry off deaktivieren und über gcluster telemetry on wieder aktivieren.

Kernfunktionen

  • Turnkey-Cluster-Deployment: Effiziente Erstellung und Bereitstellung von HPC-, KI- und ML-Clustern nach Google-Cloud-Best-Practices.
  • Konfigurierbares Open-Source-Framework: Anpassung und Erweiterung über eigene Module und Blueprints.
  • Partnerintegrationen: Nahtloses Zusammenspiel mit Intel DAOS, DDN EXAScaler und Slurm.
  • Monitoring-Anbindung: Performance-Einblicke über die Integration mit Cloud Monitoring.
  • Reproduzierbare Infrastruktur: Terraform- und Packer-basierte Deployment-Ordner statt manueller Konfiguration.

Typische Anwendungsfälle

HPC-Cluster für wissenschaftliches Rechnen

Ein Forschungsteam nutzt einen Beispiel-Blueprint, um mit gcluster create und gcluster deploy schnell einen Slurm-basierten HPC-Cluster auf Google Cloud bereitzustellen.

Standardisierte KI-/ML-Trainingsumgebungen

Ein Plattformteam definiert unternehmensweite Blueprints, damit verschiedene Teams reproduzierbare KI- und ML-Cluster nach denselben Best Practices erstellen.

Integration mit spezialisiertem Storage

Für I/O-intensive HPC-Workloads wird Cluster Toolkit mit Partnerlösungen wie Intel DAOS oder DDN EXAScaler kombiniert.

Iterative Anpassung bestehender Cluster

Laufende Slurm-Partitionen oder GKE-Node-Pools werden über die von Cluster Toolkit unterstützten Aktualisierungsmechanismen angepasst, ohne den gesamten Cluster neu aufzusetzen.

Vorteile

  • Best-Practice-Infrastruktur ohne manuellen Aufbau: Blueprints kapseln bewährte Google-Cloud-Architekturmuster für HPC/KI/ML.
  • Wiederverwendbarkeit: Module lassen sich über verschiedene Blueprints und Projekte hinweg wiederverwenden.
  • Offenheit: Als Open-Source-Projekt anpassbar und erweiterbar für spezifische Anforderungen.
  • Ökosystem-Anbindung: Direkte Integration mit etablierten HPC-Partnern und Cloud Monitoring.
  • Transparente Bereitstellung: Terraform- und Packer-Konfigurationen sind einsehbar und versionierbar.

Integration mit innFactory

Als zertifizierter Google Cloud Partner unterstützt innFactory Sie beim Einsatz von Cluster Toolkit: Konzeption passender Blueprints für Ihre HPC-, KI- oder ML-Workloads, Integration mit bestehender Terraform-Infrastruktur sowie Anbindung an Monitoring- und Kostenkontrollprozesse.

Kontaktieren Sie uns für eine Beratung zu Cluster Toolkit.

Typische Anwendungsfälle

Turnkey-Bereitstellung von HPC-, KI- und ML-Clustern nach Google-Cloud-Best-Practices
Wiederholbare, versionierbare Cluster-Infrastruktur über Blueprints
Integration mit Partnerlösungen wie Slurm, Intel DAOS oder DDN EXAScaler
Performance-Überwachung bereitgestellter Cluster über Cloud Monitoring

Technische Spezifikationen

Komponente blueprint YAML-Datei, die die Cluster-Architektur über verwendete Module und deren Konfiguration definiert
Komponente deployment ordner Generiertes Verzeichnis mit Terraform- und Packer-Konfigurationen zur Bereitstellung des Clusters
Komponente gcluster Kommandozeilen-Tool, das Blueprint und Module zu einem Deployment-Ordner kompiliert
Komponente module Wiederverwendbare, konfigurierbare Bausteine für Scheduler, Storage oder Compute-Knoten
Lizenzmodell Open-Source-Tool
Partnerintegrationen Nahtlose Integration mit Partnern wie Intel DAOS, DDN EXAScaler und Slurm laut Dokumentation
Telemetrie Standardmäßig aktivierte, nicht personenbezogene Nutzungstelemetrie; über das Kommando gcluster telemetry off/on abschaltbar

Häufig gestellte Fragen

Was ist Cluster Toolkit?

Laut Google-Cloud-Dokumentation vereinfacht Cluster Toolkit die Bereitstellung von High-Performance-Computing-(HPC)-, KI- und ML-Workloads auf Google Cloud. Es handelt sich um ein quelloffenes Tool mit anpassbaren Blueprints, die dabei helfen, Infrastruktur nach Google-Cloud-Best-Practices bereitzustellen; das Toolkit lässt sich zudem für eigene Anforderungen erweitern.

Aus welchen Komponenten besteht Cluster Toolkit?

Die Dokumentation nennt vier Komponenten: das Cluster-Blueprint (eine YAML-Datei, die Architektur und Module des Clusters definiert), Module (wiederverwendbare, konfigurierbare Bausteine etwa für Scheduler, Storage oder Compute-Knoten), das Kommandozeilen-Tool gcluster, das Blueprint und Module zu einem Deployment-Ordner kompiliert, sowie den generierten Deployment-Ordner selbst, der die Terraform- und Packer-Konfigurationen für die Bereitstellung enthält.

Mit welchen Partnerlösungen integriert sich Cluster Toolkit?

Laut Dokumentation lässt sich Cluster Toolkit nahtlos mit verschiedenen Partnern integrieren, darunter Intel DAOS, DDN EXAScaler und Slurm. Zusätzlich ist eine Integration mit Cloud Monitoring vorgesehen, um Performance-Einblicke in die bereitgestellten Cluster zu erhalten.

Was kostet Cluster Toolkit?

Cluster Toolkit selbst ist als Open-Source-Tool kostenfrei nutzbar. Kosten entstehen für die über das Toolkit bereitgestellten Google-Cloud-Ressourcen, etwa Compute Engine oder Google Kubernetes Engine, gemäß der jeweils gültigen Google-Cloud-Preisliste.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.

Google Cloud Partner

innFactory ist zertifizierter Google Cloud Partner. Wir bieten Beratung, Implementierung und Managed Services.

Google Cloud Partner

Ähnliche Produkte anderer Cloud-Anbieter

Andere Cloud-Anbieter bieten vergleichbare Services in dieser Kategorie. Als Multi-Cloud Partner helfen wir bei der richtigen Wahl.

Azure

Durable Task Scheduler - Verwalteter Backend-Dienst für Durable Functions

Azure Durable Task Scheduler ist der empfohlene Speicheranbieter für Durable Functions und die Durable Task SDKs, mit …

Preismodell Dedicated SKU: fester monatlicher Preis …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
AWS

Research and Engineering Studio on AWS: Open-Source-Portal für Virtual Desktops

Research and Engineering Studio on AWS (RES) ist ein quelloffenes Webportal für virtuelle Windows- und Linux-Desktops …

Preismodell RES selbst ist laut Dokumentation …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
STACKIT

STACKIT Compute Engine - Virtuelle Maschinen

STACKIT Compute Engine: Skalierbare VMs aus deutschen und österreichischen Rechenzentren. DSGVO-konform, …

Preismodell Pay-as-you-go (stündliche Abrechnung)
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
STACKIT

STACKIT Compute Engine GPU - GPU-Instanzen

STACKIT Compute Engine GPU: NVIDIA H100, A100 und L40S aus deutschen Rechenzentren für KI-Training und Inference, …

Preismodell Pay-per-use (stündliche Abrechnung)
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
STACKIT

STACKIT Linux Server - Managed Linux VMs

STACKIT Linux Server: virtuelle Maschinen mit Ubuntu, Debian, RHEL, Rocky Linux, AlmaLinux, openSUSE u.a. aus deutschen …

Preismodell Compute-Engine-Stundenpreis pro vCPU/RAM …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
STACKIT

STACKIT Red Hat Enterprise Linux - RHEL VMs

STACKIT RHEL: Red Hat Enterprise Linux Images aus deutschen Rechenzentren, SAP-zertifiziert. DSGVO-konform.

Preismodell Pay-per-use für VM und RHEL-Lizenz …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →

62 vergleichbare Produkte bei anderen Cloud-Anbietern gefunden.

Bereit, mit Cluster Toolkit - Open-Source-Blueprints für HPC- und KI-Cluster zu starten?

Unsere zertifizierten Google Cloud Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren