Kursusel oli kokku 9 moodulit, kus iga juurde anti ka ports kohustuslikku kirjandust lugeda. Loomulikult sel ajal ma seda ei jõudnud lugeda, kuid võtan nüüd eesmärgiks kuu aega järjest lugeda. Vaatame, kuhu jõuame. Lugemine suvalises järjekorras.


Airbyte: What is Data Extraction? Data Extraction Tools and Techniques moodulist 3: andmete integreerimine. Küll väga sissejuhatuslikult, aga puudutab andmete saamisega seotud teemasid nagu eetilised aspektid ja anonümiseerimine. Just nende teemade pärast loe originaalartikli teist poolt.


Andmete väljavõtt (extraction) on esimene samm andmete integreerimisel, kus kogutakse kokku andmeid erinevatest allikatest. Artiklis jagatakse see etapp järgmisteks osadeks:


Mõisteid lisaks juba tuttavatele "ETL", "ELT", "andmetoru":


Meetoditena andmete väljavõtmiseks on veel mainitud veebikraapimine ja parsimine ( web-scraping, parsing). Veebilehtedel korjatakse infot automaatselt kasutade pythoni teeke BeautifulSoup või Selenium. Skannitud dokumentide masinloetavaks muutmine OCR (optical character recognition) ehk optilise märgituvastuse abil. Ja kui muud üle jää, siis kuhugi ei ole ka kadunud manuaalne andmete sisestus või parandamine.


Eetilised otsused


Artikkel rõhutab, et tänases reguleeritud maailmas tuleb (isiku)andmete haldamise põhimõtted ja nõuetele vastavus läbi mõelda juba andmetorude kavandamise protsessis. Kasutatakse erinevaid anonüümimise võimalusi, et tagada privaatsus, aga säilitada analüütikaks vajalikku andmestikku.


Lisaks neile ei tasu ära unustada ka eetilisi põhimõtteid andmete päritolu läbipaistvuste ning kallutatuse vältimine koodi, päringuid kirjutades või ka mõju keskkonnale:

Sellele aitab kaasa andmete päritolu jälgitavus (provenance tracking) ehk peaksime talletama:



Allikas: https://airbyte.com/data-engineering-resources/data-extraction