Zum Hauptinhalt springen
Cloud / AWS / Produkte / AWS Glue - Serverless ETL

AWS Glue - Serverless ETL

AWS Glue ist ein serverloser ETL-Service für Datenintegration, Transformation und Katalogisierung in Data Lakes.

Analytics
Preismodell Pay-per-use nach DPU-Stunde (Data Processing Unit) für ETL-Jobs und Crawler
Verfügbarkeit Verfügbar in vielen AWS-Regionen, Verfügbarkeit je Region prüfen
Datensouveränität EU-Regionen verfügbar
Zuverlässigkeit SLA gemäß Anbieter (siehe offizielle SLA-Seite) SLA

Hinweis zu einzelnen Funktionen: AWS Glue Ray Jobs sind seit dem 30. April 2026 für Neukunden geschlossen. Die übrigen Glue-Funktionen, darunter Spark-basierte ETL-Jobs und der Data Catalog, sind davon nicht betroffen.

Was ist AWS Glue?

AWS Glue ist ein serverloser Service für Datenintegration, der das Entdecken, Vorbereiten und Kombinieren von Daten aus verschiedensten Quellen vereinfacht, beschleunigt und kostengünstiger macht. Glue umfasst mehrere Komponenten: den Data Catalog als zentrales Metadaten-Repository, ETL-Funktionalität zum Erstellen und Ausführen von Datenpipelines, AWS Glue Studio für die visuelle Pipeline-Entwicklung sowie interaktive Sessions für explorative Datenaufbereitung in IDEs oder Notebooks.

Kernfunktionen

  • Data Catalog: Zentrales Metadaten-Repository für Tabellen und Schemas, kompatibel mit Athena, Redshift und EMR
  • Glue Crawlers: Automatisches Scannen von Datenquellen und Schema-Erkennung für S3, RDS und JDBC-Datenbanken
  • Glue ETL: Serverlose Spark-basierte Transformationen in Python oder Scala
  • Glue Studio: Visueller Editor für die grafische Entwicklung von ETL-Pipelines
  • Interactive Sessions: Explorative Datenaufbereitung direkt in IDEs oder Notebooks
  • Glue DataBrew: No-Code-Datenaufbereitung mit vorgefertigten Transformationen für Data Analysts und Data Scientists

Typische Anwendungsfälle

Data Lake Aufbau

Glue Crawlers scannen verschiedene Datenquellen und erstellen einen einheitlichen Katalog. ETL-Jobs transformieren Rohdaten in analysierbare Formate wie Parquet und laden sie in S3-basierte Data Lakes.

Data Warehouse Integration

Daten aus operativen Systemen werden transformiert und in Amazon Redshift geladen. Glue übernimmt Schema-Mapping, Datentyp-Konvertierung und inkrementelle Loads.

Machine Learning Datenvorbereitung

DataBrew bereinigt und normalisiert Daten für ML-Workflows. Fehlende Werte werden behandelt, Ausreißer erkannt und Features für das Training vorbereitet.

Vorteile

  • Keine Infrastruktur-Verwaltung: automatische Skalierung der zugrunde liegenden Spark-Cluster
  • Pay-per-Use-Abrechnung nach DPU-Stunden
  • Integration mit dem gesamten AWS-Analytics-Stack
  • Wiederverwendbare Transformationen und Job-Bookmarks für inkrementelle Verarbeitung

Integration mit innFactory

Als AWS Reseller unterstützt innFactory Sie bei AWS Glue: Aufbau von Data-Lake-Architekturen, Entwicklung von ETL-Pipelines in Python/Scala und Integration mit bestehenden Data-Warehouse-Systemen.

Typische Anwendungsfälle

ETL
Data catalog
Data preparation
Data integration

Häufig gestellte Fragen

Was ist AWS Glue?

AWS Glue ist ein serverloser Service für Datenintegration (ETL: Extract, Transform, Load). Er automatisiert das Entdecken, Vorbereiten und Kombinieren von Daten aus AWS-, On-Premises- und anderen Cloud-Quellen für Analytics und Machine Learning.

Was ist der AWS Glue Data Catalog?

Der Data Catalog ist ein zentrales Metadaten-Repository, das Tabellen- und Schema-Informationen über Ihre Datenquellen verwaltet. Er ist kompatibel mit Athena, Redshift Spectrum und EMR und ermöglicht so eine einheitliche Sicht auf Daten aus unterschiedlichen Quellen.

Wofür wird AWS Glue DataBrew genutzt?

Glue DataBrew ist eine visuelle No-Code-Datenaufbereitung für Data Analysts und Data Scientists. Sie ermöglicht das Bereinigen und Normalisieren von Daten über vorgefertigte Transformationen ohne eigenen Code, etwa zur Vorbereitung von Trainingsdaten für Machine Learning.

Was kostet AWS Glue?

AWS Glue wird nach genutzten DPU-Stunden (Data Processing Units) für ETL-Jobs und Crawler abgerechnet, zusätzlich fallen Kosten für den Data Catalog und optionale Komponenten wie DataBrew an. Es gibt keine Mindestgebühren; genaue Preise finden sich auf der offiziellen Pricing-Seite.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von AWS (offizielle Dokumentation). Diese Seite stellt kein Angebot von AWS dar.

AWS Cloud Expertise

innFactory ist AWS Reseller mit zertifizierten Cloud-Architekten. Wir bieten Beratung, Implementierung und Managed Services für AWS.

Ähnliche Produkte anderer Cloud-Anbieter

Andere Cloud-Anbieter bieten vergleichbare Services in dieser Kategorie. Als Multi-Cloud Partner helfen wir bei der richtigen Wahl.

Google Cloud

BigQuery Data Transfer Service - Geplante Datenübernahme

Der BigQuery Data Transfer Service automatisiert die Datenübernahme nach BigQuery auf geplanter, verwalteter Basis, ohne …

Preismodell Für übernommene Daten gelten die …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
Google Cloud

BigQuery sharing - Datenaustausch ohne Kopien

BigQuery sharing (vormals Analytics Hub) ist eine Data-Exchange-Plattform für den Austausch von Daten über …

Preismodell Keine zusätzlichen Kosten für die …
SLA SLA gemäß Anbieter (siehe offizielle SLA-Seite)
Vergleichen →
Google Cloud

Data Analytics Agents - Agentische KI für den Datenlebenszyklus

Data Analytics Agents bündelt First-Party-Agenten und Entwicklerwerkzeuge, die Data Engineering, Data Science, Analytics …

Preismodell Abrechnung über die genutzten Daten- und …
SLA SLA gemäß Anbieter je Dienst / siehe offizielle Dokumentation
Vergleichen →
Google Cloud

Google Cloud Cortex Framework - Datenbasis für SAP-Analytics

Cortex Framework liefert Solution Accelerators, die aus SAP-Quellsystemen vertrauenswürdige Datenprodukte in BigQuery …

Preismodell Für Cortex Framework veröffentlicht …
SLA gemäß Anbieter / siehe offizielle Dokumentation
Vergleichen →
Google Cloud

Telecom Data Fabric - Datenmanagement und Analytics für Telekommunikation

Telecom Data Fabric automatisiert Datenmanagement und Analytics für Telekommunikationsanbieter auf Basis mehrerer …

Preismodell Derzeit in Private Preview; für Preise …
SLA SLA gemäß Anbieter / siehe offizielle Dokumentation
Vergleichen →
Azure

Azure Analysis Services: BI-Datenmodelle

Azure Analysis Services bietet Enterprise-BI-Datenmodellierung für schnelle, interaktive Analysen mit Power BI und …

Preismodell Tier-basiert (Developer, Basic, …
SLA 99,9% für Basic- und Standard-Tier; Developer-Tier ohne SLA
Vergleichen →

43 vergleichbare Produkte bei anderen Cloud-Anbietern gefunden.

Bereit, mit AWS Glue - Serverless ETL zu starten?

Unsere zertifizierten AWS Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren