Hvad er en data lake?

Af Weapp · Opdateret

En data lake er et centralt lagringssted hvor rådata gemmes i deres originalformat og først struktureres når de skal bruges. Alt lægges ind som det er, f.eks. tekst, logs, tabeller og billeder, og formes efter behov senere. Det er ofte udgangspunktet for AI og analyse, men uden katalog og ejerskab risikerer søen at blive en uoverskuelig datasump.

Data lake, eller datasø, er et begreb der dukker op så snart en virksomhed begynder at tale om AI, analyse eller om at “gøre noget med alle vores data”. Men hvad en data lake faktisk er og hvad der adskiller den fra et almindeligt data warehouse, er langtfra indlysende. Her er forklaringen og den typiske fælde man skal passe på.

Hvad en data lake er

En data lake er et centralt lagringssted hvor du kan hælde data af alle slags ind i deres originalformat uden først at bestemme hvordan de skal bruges. Logs, tabeller fra ERP-systemer, tekstdokumenter, billeder, måleværdier fra sensorer: Alt kan ligge side om side, præcis som det kom ind.

Billedet er netop en sø. Vand fra mange kilder løber ud i den samme sø og blandes der, uanset hvor det kom fra. På samme måde samles data fra vidt forskellige systemer i data laken, i den form de ankom i. Først når nogen skal bruge en bestemt del, bliver den struktureret og formet efter det spørgsmål der stilles.

Det er den afgørende egenskab: Strukturér ved behov, ikke ved indlæsning. Du gemmer først og bestemmer formen senere.

Kontrasten til et data warehouse

Den bedste forståelse får man ved at stille søen op mod dens modpol, datavarehuset (data warehouse). De løser det samme overordnede problem, nemlig at samle data til analyse, men i omvendt rækkefølge.

EgenskabData lake (sø)
Hvornår struktureres data?Ved brug: rådata gemmes først
Hvilke data?Alt, i originalformat: tekst, logs, billeder, tabeller
Største styrkeFleksibilitet og kapacitet til ukendte fremtidige behov
Største risikoBliver en uoverskuelig sump uden orden

Et data warehouse gør det modsatte af søen: Det renser og strukturerer data før de gemmes så de ligger ordnet og klar til analyse. Datavarehuset er pænt og hurtigt til kendte spørgsmål; data laken er rummelig og fleksibel til spørgsmål man endnu ikke har stillet. Mange større organisationer bruger begge: søen som råvarelager, datavarehuset som det oprensede udstillingsvindue.

Hvorfor AI og analyse ofte begynder her

Data laken er blevet udgangspunktet for mange data- og AI-initiativer, og det er ikke tilfældigt. Den slags projekter er kendetegnet ved at de har brug for mange og varierede data og sjældent ved præcis på forhånd hvad de kommer til at få brug for.

En AI-model kan skulle trænes på alt fra logs til fritekst til billeder. En analytiker der udforsker et nyt forretningsproblem, ved ikke på forhånd hvilke felter der bliver relevante. Data laken passer til den fase fordi den tager imod alt i oprindelig form og lader en udforske frit i stedet for at tvinge beslutninger om struktur igennem før man ved hvad man leder efter.

Et konkret scenarie

En virksomhed vil begynde at bruge AI til at forudsige hvornår maskiner har brug for vedligeholdelse. Den ved ikke præcis hvilke data der vil vise sig at være afgørende, så den begynder med at samle alt hvad den har, i en data lake: sensormålinger, servicehistorik, fejlrapporter i fritekst, driftslogs.

I søen ligger alt i rå form. Når datateamet så eksperimenterer, trækker de netop de dele ud som en bestemt model har brug for, og strukturerer dem uden at have skullet bestemme det på forhånd. Havde de i stedet været tvunget til at rense og forme alle data før de måtte gemme dem, var projektet gået i stå før det overhovedet var begyndt. Fleksibiliteten var forudsætningen.

Advarslen: Søen kan blive en sump

Her er den fælde som mange går i. Netop det der gør data laken kraftfuld, nemlig at alt må hældes ind uden orden, gør den farlig hvis den overlades til sig selv. Uden styring forvandles den fleksible sø til en datasump: en uoverskuelig bunke hvor ingen ved hvad der findes, hvor det kommer fra eller om det er til at stole på.

To ting holder søen sund:

  • Et katalog. Noget der beskriver hvad der findes i søen, altså hvilke data, hvorfra og i hvilken stand, så de kan findes og forstås.
  • Ejerskab. Et tydeligt ansvar for de forskellige datamængder så nogen står inde for kvaliteten og ved hvorfor de findes.

Uden katalog og ejerskab bliver søen ubrugelig netop når I har mest brug for den. Orden og ansvar er ikke bureaukrati her, men forskellen på et aktiv og en belastning.

Sådan tager du næste skridt

En data lake betaler sig når I har store mængder varierede data og reelle ambitioner inden for analyse eller AI, ikke som en trend man hopper på. Går I i gang, så planlæg katalog og ejerskab fra dag ét, ikke som en lap man syr på bagefter. Vil I bygge et datafundament der bliver et aktiv og ikke en sump, tager vi hos Weapp det gerne med i systemarbejdet fra begyndelsen.

Ofte stillede spørgsmål

Hvad er forskellen på en data lake og et data warehouse?

En data lake gemmer rådata i originalformat og strukturerer dem først når de skal bruges. Et data warehouse gør det modsatte: Data renses og struktureres før de gemmes. Groft sagt strukturerer søen efter behov, datavarehuset på forhånd. Søen er fleksibel og rummelig, datavarehuset ordnet og klar til analyse. Mange større organisationer bruger begge sammen.

Hvorfor gemmer man rådata i originalformat?

For fleksibilitetens skyld. Når man gemmer alt som det er, uden på forhånd at bestemme hvordan det skal bruges, låser man sig ikke fast på ét enkelt formål. Fremtidige spørgsmål og analyser man endnu ikke har tænkt på, kan så besvares ud fra de samme data. Prisen er at data ligger uordnet indtil nogen strukturerer dem når de bruges.

Hvorfor begynder AI- og analyseprojekter ofte i en data lake?

Fordi den slags projekter har brug for mange og varierede data og sjældent ved præcis hvad de skal bruge fra starten. En data lake kan tage imod alt i oprindelig form, f.eks. logs, tekst, billeder og måleværdier, og gøre det tilgængeligt for udforskning og modeltræning. Fleksibiliteten og kapaciteten passer netop til den eksperimenterende, datasultne fase.

Hvad menes der med at søen bliver en sump?

At den bliver en uoverskuelig bunke hvor ingen længere ved hvad der findes, hvor det kommer fra eller om det er til at stole på. Uden et tydeligt ejerskab af data og et katalog der beskriver indholdet, forvandles den fleksible sø til en datasump som ingen tør bruge. Orden og ansvar er det der holder søen brugbar.

Har alle virksomheder brug for en data lake?

Nej. En data lake betaler sig først når I har store mængder varierede data og reelle behov inden for analyse eller AI. For mindre organisationer med overskuelige, overvejende strukturerede data rækker enklere løsninger fint, og en data lake bliver mest en dyr og vedligeholdelseskrævende overbygning. Behovet, ikke trenden, bør afgøre det.