Integracija podatkov v podatkovnem jezeru
Azure Data Lake Storage – Data Lakehouse
ProjectScientificProfessional

- Podatkovno jezero razvito v rešitvi Azure Data Lake Storage Gen2 nadgrajeno s konceptom podatkovnih kolišč (ang. Data Lakehouse).
- Shranjuje različno strukturirane podatke zajete iz več virov v različne cone odvisno od stopnje njihove obdelave. (surovi, prečiščeni ali zbirni podatki).
- Vključuje implementacijo avtomatiziranega podatkovnega cevovoda (ang. Data Pipeline) v oblačni storitvi Azure Databricks, ki poskrbi, da se podatki iz surove oblike obdelajo v zbirno obliko ustrezno za daljno uporabo.
- Temelječa na uporabi tabel Delta za učinkovito obdelavo velike količine podatkov v podatkovnem jezeru
Rešuje ali naslavlja:
- zahtevno integracijo razpršenih podatkov,
- nezadostno kakovost podatkov za izvedbo nadaljnjih analiz,
- učinkovitost obdelave različno strukturiranih in surovih podatkov


