Data se uloží syrová, transformují se až uvnitř skladu
ELT je zkratka pro Extract, Load, Transform. Popisuje pořadí tří kroků, kterými data ze zdrojů, třeba e-shopu, účetnictví nebo reklamních účtů, projdou, než se dají použít v reportu nebo segmentaci.
Extract: data se vytáhnou ze zdroje
Objednávky z e-shopu, faktury z účetnictví nebo náklady z reklamních účtů se stáhnou ze zdrojového systému tak, jak v něm existují.
Load: uloží se do skladu beze změny
Data se hned nahrají do datového skladu, typicky BigQuery, v syrové podobě. Nic se předem nečistí, nespojuje ani nepřepočítává, do skladu jde přesně to, co přišlo ze zdroje.
Transform: transformace proběhne až tam
Teprve uvnitř skladu se syrová data spojí, vyčistí a přepočítají pomocí výpočetního výkonu samotného skladu, typicky přes verzované SQL transformace (viz pojem Dataform).
Kde firmy pálí peníze
ELT má svoje typické chyby, uložit data syrová sama o sobě nic nevyřeší.
Syrová data bez transformací jako datové jezero
Bez verzovaných a testovaných transformací (viz pojem Dataform) se sklad naplní syrovými daty, kterým čím dál míň lidí rozumí. Tomu se říká datové jezero, sklad plný dat bez použitelné struktury nad nimi.
Podcenění, že i syrová data něco stojí
Syrová data v BigQuery stojí peníze za úložiště a za skeny při každém dotazu, i dřív, než se z nich cokoli reálně postaví. Firma na to často zapomene, protože žádný report zatím neexistuje.
Transformace jako jednorázová akce, ne proces
Data se do skladu naimportují a transformace se udělá jednou ručně. Když přibude nový zdroj nebo se změní struktura dat, nikdo neví, jestli se transformace ještě spustí správně.
Proč se ELT stal dnes běžnou volbou
Dokud byl výpočet pro transformace drahý, dávalo smysl transformovat data předem, mimo sklad. Cloudové sklady jako BigQuery mají výpočet lacinější a pružnější, takže se transformace vyplatí dělat rovnou uvnitř nich.
Levný a pružný výpočet přímo ve skladu
Sklad nepotřebuje samostatný transformační server navíc, výpočet, který transformace potřebují, se škáluje v rámci skladu podle toho, kolik dat se zrovna zpracovává.
Syrová data zůstávají po ruce
Protože se do skladu nejdřív uloží syrová podoba dat, jde se k ní kdykoli vrátit a přepočítat ji jinak, i kdyby se později ukázalo, že některá transformace byla nastavená chybně.
Standard, na který Datimo staví u nových skladů
U nových datových skladů je ELT výchozí přístup Datimo. Plné srovnání s ETL a důvody, proč tahle volba dává smysl konkrétně v BigQuery, jsou na stránce ETL vs. ELT.
