Konzeption und Architektur
摘要
Moderne Datenmanagementarchitekturen, die auf Data Lakes basieren, speichern Daten aus verschiedenen Datenquellen in ihrer ursprünglichen Rohform. Anschließend werden die Daten aufbereitet, angereichert und in Formate konvertiert, die von verschiedenen Anwendungen genutzt werden können. Dieser mehrstufige Prozess wird durch die Aufteilung der Datenpersistenz in verschiedene Zonen erreicht. Dieses Kapitel befasst sich mit der Konzeption und der Architektur von Data Lakes, wobei ein besonderer Schwerpunkt auf dem Zonenmodell liegt, das die Datenpersistenz in verschiedene Zonen unterteilt. Typische Zonen wie die Raw Data Zone, die Landing Zone, die Staging Zone und die Analytics Zone, die jeweils unterschiedliche Funktionen und Benutzer haben, werden beschrieben. Zusätzlich werden optionale Zonen wie die Data Governance Zone und die Sandbox Zone erläutert. Das Kapitel stellt auch Reifegradmodelle wie Data Swamps, Data Puddles, Data Lakes und Data Oceans vor und diskutiert, warum es in der Praxis mehrere Data Lakes geben kann. Des Weiteren werden Architekturelemente wie Data Warehouse und Data Lakehouse, Datenflüsse (ETL und ELT), Data Governance und Metadatenmanagement behandelt. Schließlich werden technische Umsetzungsmöglichkeiten wie Hadoop, Objektspeicher, Cloud-Lösungen, NoSQL-Datenbanken, In-Memory-Datenbanken sowie Data Lakehouse-Technologien (Delta Lake, Apache Iceberg, Apache Hudi) vorgestellt.