Azure Databricks ist eine Apache-Spark-basierte Analytics-Plattform, die von Databricks und Microsoft gemeinsam entwickelt wird. Der Service kombiniert die Leistungsfähigkeit von Spark mit nativer Azure-Integration für Data Engineering, Machine Learning und Analytics.
Was ist Azure Databricks?
Azure Databricks ist eine Unified-Analytics-Plattform, die Data Engineering, Data Science und Business Analytics in einer Umgebung vereint. Der Service basiert auf Apache Spark, bietet aber erhebliche Optimierungen und zusätzliche Features:
1. Optimierte Spark-Engine: Die Databricks Runtime ist gegenüber Open-Source-Spark durch optimierte Caching-Mechanismen, Adaptive Query Execution und Auto-Scaling deutlich performanter.
2. Kollaborative Notebooks: Multi-User-Notebooks mit Live-Collaboration, die Python, Scala, SQL und R in einer Datei unterstützen.
3. Delta Lake: ACID-Transaktionen für Data Lakes ermöglichen zuverlässige Batch- und Streaming-Workloads auf derselben Datenbasis.
4. MLflow-Integration: Vollständig integriertes ML-Lifecycle-Management für Experiment Tracking, Model Registry und Deployment.
5. Unity Catalog: Zentraler Governance-Layer für Datenzugriff, Lineage und Auditing über Workspaces hinweg — heute Standardkomponente neuer Databricks-Umgebungen.
Die native Azure-Integration ermöglicht direkten Zugriff auf Azure Data Lake Storage Gen2, Blob Storage, SQL Database, Cosmos DB und weitere Services. Die Authentifizierung erfolgt über Microsoft Entra ID (vormals Azure Active Directory) und Managed Identities.
Für Datenverarbeitung mit europäischem Fokus ist Databricks in EU-Regionen wie Germany West Central oder West Europe verfügbar. Der Premium-Tarif erfüllt gängige Compliance-Standards wie ISO 27001 und SOC 2.
Wichtiger Hinweis zum Tarifmodell: Microsoft stellt den bisherigen Standard-Tarif ein. Seit April 2026 lassen sich keine neuen Standard-Workspaces mehr anlegen, zum 1. Oktober 2026 werden verbleibende Standard-Workspaces automatisch auf Premium migriert. Premium ist damit faktisch der einzige Tarif für neue Projekte.
Delta Lake: ACID für Data Lakes
Delta Lake löst klassische Probleme von Parquet/ORC-basierten Data Lakes:
Problem: Inkonsistente Daten. Klassische Data Lakes kennen keine Transaktionen — bei einem fehlgeschlagenen Job bleiben Partial Writes zurück. Delta Lake garantiert Atomarität: Ein Batch wird entweder vollständig oder gar nicht geschrieben.
Problem: Langsame Queries. Full Table Scans sind bei sehr großen Datasets ineffizient. Delta Lake optimiert das File-Layout über Z-Ordering und überspringt irrelevante Dateien anhand von Statistiken (Data Skipping).
Problem: Riskante Schema-Änderungen. Delta Lake unterstützt Schema Merge und Evolution ohne Downtime.
Problem: Fehlende Versionierung. Über Time Travel lässt sich auf frühere Versionen einer Tabelle zugreifen, z.B. mit SELECT * FROM table VERSION AS OF 5.
Delta Lake ist Open Source (Linux Foundation) und ein De-facto-Standard für moderne Lakehouse-Architekturen.
Cluster-Typen und Compute-Optionen
Databricks bietet verschiedene Compute-Optionen:
| Typ | Verwendung | Auto-Terminate | Best for |
|---|---|---|---|
| All-Purpose Compute | Interaktive Notebooks | Ja (konfigurierbar) | Entwicklung, Exploration |
| Jobs Compute | Geplante/automatisierte Jobs | Automatisch nach Job | Produktions-Workloads |
| SQL Warehouse | SQL-Analytics (serverless möglich) | Automatisch | BI-Tools, Ad-hoc-Queries |
| Photon | Optimierte Query-Engine | - | Large-Scale Analytics |
Die konkrete VM-Größe richtet sich nach Datenvolumen und Workload-Typ; für GPU-Workloads stehen entsprechende GPU-VM-Familien zur Verfügung. Mit Auto-Scaling passen sich Cluster automatisch an die Workload an, für variable Lasten empfiehlt sich zusätzlich der Einsatz von Cluster Pools, um Start-Zeiten zu verkürzen.
Typische Anwendungsfälle
- Data Engineering und ETL: Transformation roher Daten zu analytisch nutzbaren Datasets, z.B. Ingestion von Event-Hub-Daten mit PySpark und Speicherung als Delta Lake.
- Machine Learning Model Training: Training von ML-Modellen auf großen Datasets mit verteiltem Computing und MLflow-Tracking.
- Echtzeit-Analytics: Verarbeitung von Streaming-Daten, etwa IoT-Sensordaten, mit Structured Streaming.
- Lakehouse-Architekturen: Kombination der Vorteile von Data Lakes und Data Warehouses nach dem Bronze-Silver-Gold-Muster mit Delta Lake.
- LLM Fine-Tuning: Training bzw. Fine-Tuning von Custom Language Models auf GPU-Clustern.
- Advanced Analytics: Komplexe Analysen wie Customer Segmentation, die mit SQL allein nicht abbildbar sind.
Vorteile
- Verwaltete, optimierte Spark-Umgebung ohne manuelles Cluster-Management
- Durchgängige Governance und Lineage über Unity Catalog
- Enge Integration in das Azure-Ökosystem (Storage, Entra ID, Data Factory)
- Ein Tool für Data Engineering, Data Science und BI/SQL-Analytics
Integration mit innFactory
Als Microsoft Solutions Partner unterstützt innFactory bei:
- Lakehouse-Architekturen: Design und Implementierung moderner Data Platforms
- Migration: Von On-Premises Hadoop/Spark zu Azure Databricks sowie Migration bestehender Standard-Workspaces auf Premium
- ML-Pipelines: End-to-End-ML-Workflows mit MLflow
- Performance-Optimierung: Cluster-Tuning und Kostenreduktion
- Training & Enablement: Team-Schulungen für Databricks
Kontaktieren Sie uns für eine unverbindliche Beratung zu Azure Databricks und Analytics-Plattformen.
Verfügbare Varianten & Optionen
Premium
- Role-Based Access Control (RBAC) und Unity Catalog als Standard-Governance-Layer
- Audit Logs und umfassende Compliance-Features
- Azure Private Link und erweiterte Sicherheitsfeatures
- Aktuell einziger für Neuanlagen unterstützter Tarif
- Höhere DBU-Kosten als der frühere Standard-Tarif
Standard (wird eingestellt)
- Einfacherer, günstigerer Einstieg für bestehende Alt-Workspaces
- Seit April 2026 können keine neuen Standard-Workspaces mehr angelegt werden
- Microsoft migriert alle verbleibenden Standard-Workspaces automatisch zu Premium (Retirement zum 1. Oktober 2026)
- Kein Unity Catalog, kein tabellenbasiertes RBAC
SQL Warehouses (Serverless)
- Instant Compute ohne manuellen Cluster-Start
- Abrechnung nach Nutzung (Pay-per-Query/-DBU)
- Auto-Scaling für BI- und Ad-hoc-Workloads
- Nur für SQL-Workloads, kein Python/Scala
Typische Anwendungsfälle
Technische Spezifikationen
Häufig gestellte Fragen
Was ist der Unterschied zwischen Azure Databricks und Apache Spark?
Azure Databricks ist eine optimierte, verwaltete Spark-Distribution mit zusätzlichen Features wie Auto-Scaling, einer performanteren Runtime, kollaborativen Notebooks, MLflow-Integration und nativer Azure-Anbindung. Sie müssen keine Cluster manuell aufsetzen oder patchen.
Was ist Delta Lake und warum sollte ich es nutzen?
Delta Lake ist ein Open-Source-Storage-Layer über Parquet, der ACID-Transaktionen, Schema Evolution und Time Travel bietet. Es löst klassische Data-Lake-Probleme wie inkonsistente Daten und ist Standard-Speicherformat in Databricks.
Was kostet Azure Databricks?
Die Kosten setzen sich aus Azure-VM-Kosten und DBU-Kosten (Databricks Units) zusammen; die DBU-Rate hängt vom Compute-Typ ab (Jobs Compute, All-Purpose Compute, SQL-Serverless). Konkrete Preise variieren nach Region und Commitment und sollten über den Azure-Preisrechner ermittelt werden.
Was ist mit dem Standard-Tarif passiert?
Der Standard-Tarif wird eingestellt: Seit April 2026 können keine neuen Standard-Workspaces mehr erstellt werden, zum 1. Oktober 2026 migriert Microsoft alle verbleibenden Standard-Workspaces automatisch zu Premium. Premium ist damit faktisch der Basistarif für Azure Databricks.
Kann ich Databricks für LLM-Training nutzen?
Ja, Databricks bietet GPU-Cluster (z.B. mit NVIDIA-A100-Instanzen), verteiltes Training und Integration mit Hugging Face. Das eignet sich für Fine-Tuning von LLMs oder Training eigener Modelle.
Unterstützt Databricks Streaming?
Ja, Structured Streaming ist vollständig integriert. Daten aus Event Hub, Kafka oder IoT Hub lassen sich in Echtzeit verarbeiten und direkt in Delta Lake schreiben; Auto Loader vereinfacht die Ingestion neuer Dateien.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Azure (offizielle Dokumentation). Diese Seite stellt kein Angebot von Azure dar.
