Was ist Amazon Athena?
Amazon Athena ist ein serverloser Query-Service, der SQL-Abfragen direkt auf Daten in Amazon S3 ausführt. Ohne Infrastruktur-Setup können Sie sofort mit der Analyse von Daten in Ihrem Data Lake beginnen.
Athena für SQL basiert auf Trino mit vollständiger Standard-SQL-Unterstützung. Zusätzlich bietet Athena eine Apache-Spark-Umgebung für interaktive, notebookbasierte Datenverarbeitung.
Kernfunktionen
- Serverless: Keine Server zu verwalten, keine Cluster zu konfigurieren
- Standard-SQL: ANSI-SQL-kompatibel mit Trino-Engine
- Apache Spark: Interaktive, vollständig verwaltete Spark-Umgebung mit schnellem Startverhalten
- Datenformat-Support: CSV, JSON, Parquet, ORC, Avro sowie Table-Formate wie Apache Iceberg und Apache Hudi
- Federated Queries: Abfragen über S3 hinaus zu Redshift, DynamoDB und weiteren AWS-, On-Premises- und Cloud-Datenquellen über Konnektoren
- Glue-Integration: Automatische Schema-Erkennung mit AWS Glue Data Catalog
Typische Anwendungsfälle
Log-Analyse: CloudTrail-Logs, VPC Flow Logs oder Application Logs in S3 mit SQL analysieren. Partitionierung nach Datum ermöglicht schnelle Abfragen über große Datenmengen.
Data Lake Analytics: Ad-hoc-Abfragen auf den Data Lake ohne Datenverschiebung. Analysten können selbständig Daten explorieren, auch mit Apache-Iceberg-Tabellen für transaktionale Data-Lake-Anwendungsfälle.
BI-Integration: Athena als Datenquelle für Amazon Quick Suite (vormals QuickSight), Tableau oder Power BI. Die Daten bleiben in S3, nur Query-Ergebnisse werden übertragen.
Vorteile
- Keine Infrastruktur-Kosten bei On-Demand-Nutzung, nur Zahlung pro gescanntem TB
- Sofortiger Start ohne Cluster-Provisionierung
- Native Integration mit S3 und Glue Data Catalog
- Skaliert automatisch für jede Query-Größe, inklusive Apache-Spark-Workloads
Integration mit innFactory
Als AWS Reseller unterstützt innFactory Sie bei Amazon Athena: Data-Lake-Architektur, Query-Optimierung, Kostenmanagement und BI-Integration.
Typische Anwendungsfälle
Häufig gestellte Fragen
Was kostet Amazon Athena?
Bei On-Demand-Nutzung berechnet Athena einen Preis pro TB gescannter Daten. Alternativ stehen Capacity Reservations mit einem Preis pro Data Processing Unit (DPU) pro Stunde für planbare Workloads zur Verfügung. Durch komprimierte, partitionierte Daten in Spaltenformaten wie Parquet lässt sich die gescannte Datenmenge und damit die Kosten deutlich reduzieren.
Welche Datenformate unterstützt Athena?
CSV, JSON, ORC, Avro, Parquet und weitere. Spaltenformate wie Parquet und ORC sind am effizientesten, da nur benötigte Spalten gelesen werden. Zudem unterstützt Athena moderne Table-Formate wie Apache Iceberg, Apache Hudi und Apache Hive.
Muss ich Server oder Cluster verwalten?
Nein. Athena ist vollständig serverless. Sie führen Queries aus, Athena skaliert automatisch. Keine Kapazitätsplanung oder Cluster-Wartung erforderlich.
Kann ich mit Athena auch Apache Spark nutzen?
Ja. Athena unterstützt Apache Spark für interaktive, notebookbasierte Datenanalyse mit schnellem Start, zusätzlich zur klassischen SQL-Abfrage-Engine.
Wie kann ich Athena-Kosten optimieren?
Partitionieren Sie Daten nach häufig gefilterten Spalten, verwenden Sie Spaltenformate wie Parquet, komprimieren Sie Daten und nutzen Sie Athena Workgroups für Query-Limits.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von AWS (offizielle Dokumentation). Diese Seite stellt kein Angebot von AWS dar.