Kursusel oli kokku 9 moodulit, kus iga juurde anti ka ports kohustuslikku kirjandust lugeda. Loomulikult sel ajal ma seda ei jõudnud lugeda, kuid võtan nüüd eesmärgiks kuu aega järjest lugeda. Vaatame, kuhu jõuame. Lugemine suvalises järjekorras.
Datacamp: ETL vs ELT: Understanding the Differences and Making the Right Choice moodulist 3: andmete integreerimine, vaatab üle ETL ja ELT, aga midagi uut otseselt juurde ei lisa.
Andmete integratsioon ühendab erinevatest allikatest pärit andmed, pakkudes nii terviklikku ülevaadet ja andes teavet võimalustest ettevõtte tegevuste tõhustamiseks. Kaks peamist meetodit selleks on meile juba tuttavad ETL, ja ELT.
ETL (extract, transform, load)
Andmed kogutakse erinevates allikatest. → Seejärel viiakse need vajalikule kujule, kas puhastades, rikastades, agregeerides või mõnel muul viisil, mis aitab kindlat eesmärki täita. → Andmed laaditakse sihtkohta. ETL lähenemine sobib hästi, kui:
- andmeallikaid pole palju, aga transformatsioonid võivad olla keerukad
- andmetöötlus ei saa toimuda mingil põhjusel sihtkohas, nt koormab seda liialt
- turvalisuse kaalutlustele tuleb andmed anonümiseerida või pseudonümiseerida enne sihtkohta laadimist
Andmete järjepidevuse, turvalisuse ja kvaliteedi üle on suurem kontroll (sh andmelekke vältimine), sest andmed viiakse vastavusse äri ja nõutud standarditega enne andmelattu laadimist.
Tööriistadest võiks kasutada ETLi puhul pythoni teeke. Pandase DataFrame andmestruktuuri andmete paindlikumaks eraldamise ja teisendamise lihtsustamiseks. PySparki hajusandmetöötluseks, st sobib ka suurematele andmemahtudele. Andmetoru orkestreerimiseks Airflow.
ELT (extract, load, transform)
Andmed kogutakse erinevates allikatest. → Toorandmed laaditakse sihtkohta. → Andmete töötlemine toimub andmelaos. ETL esiletõus on toimunud pilveteenuste Snowflake, BigQuery jm kasutusele võtu ja populaarsuse suurenemisega. Lähenemine sobib hästi, sest:
- paindlik. Toorandmed laetud, saab hiljem otsustada täpse ärivajaduse üle ning seda ka kergemini muuta ärireeglite muutudes.
- tõhusam. Andmetöötlus kasutab ära pilveteenuste töötlusvõimsust.
- suured andmemahtude korral pilve paralleeltöötlusvõimalused (MPP).
Maskimata andmed on kättesaadavad sihtsüsteemis ja seega ligipääs on neile olemas kuni töötlemisprotessi lõpuni.
ETL ja ELT valikul tuleks kaaluda, kas turvalisus või paindlikkus, kas partii-põhine või reaalajas andmetöötlus, olemasolev võimekus (tööriistad, inimesed).