Was ist Amazon SageMaker HyperPod?
Amazon SageMaker HyperPod ist eine dedizierte, verwaltete Infrastruktur-Plattform, die speziell für das Training und Fine-Tuning sehr großer KI-Modelle, insbesondere Large Language Models (LLMs) und Foundation Models, entwickelt wurde. Während reguläre EC2-GPU-Instanzen für das Training kleiner und mittlerer Modelle ausreichen, stoßen sie bei Trainingsläufen über hunderte oder tausende Beschleuniger über Tage und Wochen an ihre Grenzen. Der entscheidende Vorteil von HyperPod ist die automatische Fehlertoleranz: Fällt ein Knoten während eines laufenden Trainings aus, erkennt HyperPod dies automatisch, ersetzt den Knoten und setzt das Training vom letzten Checkpoint fort, ohne den gesamten Job neu starten zu müssen.
Kernfunktionen
- Automatische Resilienz: HyperPod überwacht Cluster-Knoten kontinuierlich, erkennt Hardware- und Netzwerkfehler automatisch und tauscht defekte Knoten aus, ohne dass der gesamte Trainingslauf neu gestartet werden muss.
- Flexible Orchestrierung: Unterstützung für Slurm (klassische HPC-Workflows mit Queue-Verwaltung) und Amazon EKS (containerisierte, Kubernetes-basierte MLOps-Pipelines).
- Hochperformantes Networking: AWS Elastic Fabric Adapter (EFA) für niedrige Latenz und hohen Durchsatz bei kollektiven Kommunikationsoperationen (All-Reduce, All-Gather) in Frameworks wie PyTorch DDP, DeepSpeed oder Megatron-LM.
- UltraServer-Unterstützung: Für Modelle im Billionen-Parameter-Bereich lassen sich mehrere GPU-Instanzen über NVLink zu einer Einheit mit gemeinsamem GPU-Speicher zusammenschließen.
- HyperPod Recipes: Voroptimierte Trainings- und Fine-Tuning-Konfigurationen für populäre Modellarchitekturen wie Llama, Mistral, Amazon Nova und andere Open-Source-Foundation-Models mit integrierten Parallelisierungsstrategien (Tensor Parallelism, Pipeline Parallelism, Data Parallelism).
- Task Governance und Observability: Zentrale Steuerung der Ressourcenzuteilung zwischen Trainings-Jobs sowie einheitliche Sichtbarkeit über Cluster und Jobs hinweg.
Typische Anwendungsfälle
Training großer Sprachmodelle: Verteiltes Pretraining und Fine-Tuning von LLMs über viele GPU- oder Trainium-Knoten hinweg, ohne dass Node-Ausfälle den gesamten Trainingslauf gefährden.
Foundation-Model-Pretraining: Aufbau eigener Foundation Models für spezialisierte Domänen, bei denen Trainingsläufe über Tage oder Wochen laufen und persistente, überwachte Cluster benötigen.
Fine-Tuning und RLHF: Anpassung bestehender Open-Source- oder proprietärer Modelle an unternehmensspezifische Daten mithilfe vorkonfigurierter HyperPod Recipes.
Inferenz für sehr große Modelle: Über UltraServer-Konfigurationen lassen sich auch Inferenz-Workloads für Modelle im Billionen-Parameter-Bereich betreiben, bei denen das gesamte Modell im gemeinsamen GPU-Speicher eines NVLink-Verbunds gehalten wird.
Vorteile
- Deutlich reduziertes Risiko von Kosten- und Zeitverlust durch automatische Erkennung und Behebung von Hardware-Ausfällen
- Geringerer operativer Aufwand gegenüber selbst verwalteten GPU-Clustern, da Provisioning, Software-Stack und Monitoring von AWS übernommen werden
- Kompatibilität mit gängigen Orchestrierungs- und Trainingsframeworks (Slurm, Kubernetes/EKS, PyTorch, DeepSpeed)
- Voroptimierte Recipes verkürzen die Zeit bis zum ersten produktiven Trainingslauf
Integration mit innFactory
Als AWS Reseller unterstützt innFactory Unternehmen, die LLMs oder spezialisierte Foundation Models trainieren oder fine-tunen möchten, bei der Konzeption der Trainingsinfrastruktur, der Auswahl der passenden Instanztypen und der Optimierung von Trainingskosten auf SageMaker HyperPod.
Typische Anwendungsfälle
Häufig gestellte Fragen
Was ist Amazon SageMaker HyperPod?
SageMaker HyperPod ist eine verwaltete Infrastruktur-Lösung für das Training sehr großer KI-Modelle. Im Gegensatz zu Standard-EC2-Instanzen bietet HyperPod persistente GPU-Cluster mit automatischer Knotenwiederherstellung, sodass bei einem Node-Ausfall der Trainings-Job automatisch fortgesetzt wird, ohne komplett neu starten zu müssen.
Was steckt hinter den HyperPod UltraServern?
HyperPod unterstützt UltraServer-Konfigurationen, bei denen mehrere GPU-Instanzen (z.B. auf Basis von NVIDIA-Blackwell-Superchips) über NVLink zu einer Einheit mit gemeinsamem GPU-Speicher verbunden werden. Zusätzlich nutzt HyperPod AWS Elastic Fabric Adapter (EFA) für die Netzwerkkommunikation zwischen Knoten. Die konkrete Bandbreite hängt von der jeweiligen Instanz- und UltraServer-Generation ab und wird in der AWS-Dokumentation zu den einzelnen EC2-Instanztypen ausgewiesen.
Wie funktioniert die automatische Knotenwiederherstellung?
HyperPod überwacht kontinuierlich alle Cluster-Knoten. Fällt ein GPU-Knoten aus (Hardware-Fehler, Netzwerkproblem), erkennt HyperPod dies automatisch, ersetzt den defekten Knoten durch einen neuen und lädt den zuletzt gespeicherten Checkpoint. Ohne HyperPod müsste ein Training-Job bei einem Node-Ausfall komplett neugestartet werden, was bei wochenlangen Trainingsläufen enorme Kosten bedeutet.
Welche Orchestrierung unterstützt HyperPod?
HyperPod unterstützt zwei Orchestrierungsoptionen: Slurm, das in HPC-Umgebungen für Batch-Job-Scheduling weit verbreitet ist, sowie Amazon EKS für containerisierte, Kubernetes-basierte MLOps-Workflows. Beide Optionen bieten Zugriff auf die Resilienz- und Wiederherstellungsfunktionen von HyperPod.
Wann sollte ich HyperPod statt regulärer EC2-GPU-Instanzen nutzen?
Für kurze Trainingsläufe reichen oft reguläre EC2-GPU-Instanzen aus. HyperPod lohnt sich bei Trainingsläufen über mehrere Tage oder Wochen, bei denen ein Node-Ausfall sonst den gesamten Job gefährdet, sowie für Teams, die regelmäßig sehr große Modelle über viele Knoten hinweg trainieren und von integrierter Cluster-Verwaltung profitieren.
Was kostet Amazon SageMaker HyperPod?
Die Abrechnung erfolgt nach genutzter Rechenkapazität der zugrunde liegenden GPU- oder Accelerator-Instanzen, wahlweise On-Demand oder über Trainingspläne mit reservierter Kapazität. Es fallen keine zusätzlichen Grundgebühren für HyperPod selbst an; die genauen Preise je Instanztyp und Region sind der offiziellen SageMaker-HyperPod-Preisseite zu entnehmen.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von AWS (offizielle Dokumentation). Diese Seite stellt kein Angebot von AWS dar.