Co data lake znamená
Data lake, česky datové jezero, je úložiště, kam se data ukládají v surové nebo jen málo upravené podobě, blízké tomu, jak přišla ze zdroje. Na rozdíl od datového skladu (viz pojem Datový sklad) nejsou data v jezeře nutně srovnaná do čistých tabulek připravených na report, jsou tam spíš uskladněná pro pozdější zpracování.
Levné a pružné úložiště, ne hotový podklad na report
Výhoda data lake je, že do něj jde uložit prakticky cokoliv, soubory, logy, nestrukturovaná data, bez nutnosti dopředu navrhovat pevné schéma. Nevýhoda je, že samotné uložení dat ještě neznamená, že jsou připravená k použití v reportu nebo dashboardu.
Datový sklad je opačný přístup
Datový sklad naopak ukládá data už transformovaná a srovnaná do struktury, se kterou se dá rovnou počítat. Je za tím víc práce předem, ale report nebo analýza pak nevyžadují další zpracování dat za pochodu.
Kde firmy pálí peníze
Data lake sám o sobě není chyba, chyba je čekat od něj to, na co stavěný není.
Jezero plné dat, ze kterých nejde udělat report
Firma nahraje data do jezera a považuje úkol za splněný. Bez transformace do srozumitelné struktury je ale nikdo nedokáže rychle použít v reportu, data tam technicky jsou, prakticky zůstávají nepoužitelná.
Očekávání rychlosti datového skladu za cenu jezera
Data lake bývá levnější na uložení, ale dotazy nad surovými, netříděnými daty jsou pomalejší a náročnější na výpočet než nad strukturou, která je na reporting od začátku navržená.
Jezero jako výmluva, proč nebudovat sklad
Uložit data do jezera je jednodušší krok než postavit datový sklad, takže se u něj firmy někdy zastaví. Report ale nakonec stejně potřebuje strukturovaná data, otázka je jen, kdy se ta práce udělá, dřív, nebo až ve chvíli, kdy report akutně chybí.
Hranice mezi jezerem a skladem se stírá
Dělení na data lake a datový sklad bylo dřív jasnější, moderní platformy oba přístupy čím dál víc kombinují.
Lakehouse jako spojení obou světů
Microsoft Fabric je postavený na OneLake, jednom datovém jezeru pro celou firmu, nad kterým zároveň běží Lakehouse a Warehouse jako dvě různé struktury nad stejnými daty. Popisujeme to v integraci Pohoda a Microsoft Fabric. Google Cloud jde jinou cestou, BigQuery je primárně analytický sklad, i když umí číst i data ležící v surovější podobě mimo něj.
Proč Datimo drží spíš stranu skladu
Datimo standardně staví na BigQuery (viz pojem Datový sklad) a data do něj vede transformovaná, ne jako surové jezero. Cílem je rychlý a spolehlivý report, ne primárně levné uložení co nejvíc dat v nejsyrovější podobě.
