Data lake

    Data lake, česky datové jezero, je úložiště, kam se data ukládají v surové nebo jen málo upravené podobě, blízké tomu, jak přišla ze zdroje. Liší se tím od datového skladu, který ukládá data už transformovaná a srovnaná do struktury připravené na report. Na moderních platformách se oba přístupy čím dál víc prolínají.

    Co data lake znamená

    Data lake, česky datové jezero, je úložiště, kam se data ukládají v surové nebo jen málo upravené podobě, blízké tomu, jak přišla ze zdroje. Na rozdíl od datového skladu (viz pojem Datový sklad) nejsou data v jezeře nutně srovnaná do čistých tabulek připravených na report, jsou tam spíš uskladněná pro pozdější zpracování.

    Levné a pružné úložiště, ne hotový podklad na report

    Výhoda data lake je, že do něj jde uložit prakticky cokoliv, soubory, logy, nestrukturovaná data, bez nutnosti dopředu navrhovat pevné schéma. Nevýhoda je, že samotné uložení dat ještě neznamená, že jsou připravená k použití v reportu nebo dashboardu.

    Datový sklad je opačný přístup

    Datový sklad naopak ukládá data už transformovaná a srovnaná do struktury, se kterou se dá rovnou počítat. Je za tím víc práce předem, ale report nebo analýza pak nevyžadují další zpracování dat za pochodu.

    Kde firmy pálí peníze

    Data lake sám o sobě není chyba, chyba je čekat od něj to, na co stavěný není.

    • Jezero plné dat, ze kterých nejde udělat report

      Firma nahraje data do jezera a považuje úkol za splněný. Bez transformace do srozumitelné struktury je ale nikdo nedokáže rychle použít v reportu, data tam technicky jsou, prakticky zůstávají nepoužitelná.

    • Očekávání rychlosti datového skladu za cenu jezera

      Data lake bývá levnější na uložení, ale dotazy nad surovými, netříděnými daty jsou pomalejší a náročnější na výpočet než nad strukturou, která je na reporting od začátku navržená.

    • Jezero jako výmluva, proč nebudovat sklad

      Uložit data do jezera je jednodušší krok než postavit datový sklad, takže se u něj firmy někdy zastaví. Report ale nakonec stejně potřebuje strukturovaná data, otázka je jen, kdy se ta práce udělá, dřív, nebo až ve chvíli, kdy report akutně chybí.

    Hranice mezi jezerem a skladem se stírá

    Dělení na data lake a datový sklad bylo dřív jasnější, moderní platformy oba přístupy čím dál víc kombinují.

    Lakehouse jako spojení obou světů

    Microsoft Fabric je postavený na OneLake, jednom datovém jezeru pro celou firmu, nad kterým zároveň běží Lakehouse a Warehouse jako dvě různé struktury nad stejnými daty. Popisujeme to v integraci Pohoda a Microsoft Fabric. Google Cloud jde jinou cestou, BigQuery je primárně analytický sklad, i když umí číst i data ležící v surovější podobě mimo něj.

    Proč Datimo drží spíš stranu skladu

    Datimo standardně staví na BigQuery (viz pojem Datový sklad) a data do něj vede transformovaná, ne jako surové jezero. Cílem je rychlý a spolehlivý report, ne primárně levné uložení co nejvíc dat v nejsyrovější podobě.