Hva er en data lake?

Av Weapp · Oppdatert

En data lake er et sentralt lagringssted der rådata lagres i originalformat og først struktureres når de skal brukes. Alt legges inn slik det er, som tekst, logger, tabeller og bilder, og formes etter behov senere. Den er ofte utgangspunktet for AI og analyse, men uten katalog og eierskap risikerer den å bli en uoversiktlig datasump.

Data lake, eller datasjø, er et begrep som dukker opp så snart en virksomhet begynner å snakke om AI, analyse eller om å «gjøre noe med alle dataene våre». Men hva en data lake faktisk er, og hva som skiller den fra et vanlig datavarehus, er langt fra opplagt. Her er forklaringen og den vanlige fellen du bør se opp for.

Hva en data lake er

En data lake er et sentralt lagringssted der du kan helle inn data av alle slag, i originalformatet, uten først å bestemme hvordan de skal brukes. Logger, tabeller fra ERP-systemer, tekstdokumenter, bilder og måleverdier fra sensorer: Alt kan ligge side om side, akkurat slik det kom inn.

Bildet er nettopp en innsjø. Vann fra mange kilder renner ut i den samme innsjøen og blandes der, uansett hvor det kom fra. På samme måte samles data fra vidt forskjellige systemer i datasjøen, i den formen de kom i. Først når noen skal bruke en bestemt del, blir den strukturert og formet etter spørsmålet som stilles.

Det er den avgjørende egenskapen: strukturering ved behov, ikke ved innlasting. Du lagrer først og bestemmer formen senere.

Kontrasten til datavarehus

Du forstår begrepet best ved å sette datasjøen opp mot motpolen, datavarehuset (data warehouse). De løser det samme overordnede problemet, å samle data til analyse, men i motsatt rekkefølge.

EgenskapData lake (datasjø)
Når struktureres dataene?Ved bruk (rådataene lagres først)
Hvilke data?Alt, i originalformat: tekst, logger, bilder, tabeller
Største styrkeFleksibilitet og kapasitet for ukjente fremtidige behov
Største risikoBlir en uoversiktlig sump uten orden

Et datavarehus gjør det motsatte av en data lake: Det rydder og strukturerer data før de lagres slik at de ligger ordnet og klare til analyse. Datavarehuset er oversiktlig og raskt for kjente spørsmål, mens datasjøen er romslig og fleksibel for spørsmål man ennå ikke har stilt. Mange større organisasjoner bruker begge: datasjøen som råvarelager og datavarehuset som det ryddige utstillingsvinduet.

Hvorfor AI og analyse ofte begynner her

Datasjøen har blitt utgangspunktet for mange data- og AI-initiativer, og det er ingen tilfeldighet. Slike prosjekter kjennetegnes ved at de trenger mye og variert data og sjelden vet nøyaktig på forhånd hva de kommer til å trenge.

En AI-modell må kanskje trenes på alt fra logger og fritekst til bilder. En analytiker som utforsker et nytt forretningsproblem, vet ikke på forhånd hvilke felter som blir relevante. Datasjøen passer for den fasen fordi den tar imot alt i opprinnelig form og gjør det mulig å utforske fritt, i stedet for å tvinge frem beslutninger om struktur før man vet hva man leter etter.

Et konkret scenario

Et selskap vil begynne å bruke AI til å forutsi når maskiner trenger vedlikehold. Selskapet vet ikke nøyaktig hvilke data som vil vise seg å være avgjørende, og begynner derfor med å samle alle dataene sine i en data lake: sensormålinger, servicehistorikk, feilrapporter i fritekst og driftslogger.

I datasjøen ligger alt i rå form. Når datateamet deretter eksperimenterer, trekker det ut og strukturerer akkurat de delene en bestemt modell trenger, uten å ha måttet bestemme det på forhånd. Hadde teamet i stedet blitt tvunget til å rydde og forme alle dataene før det fikk lagre dem, ville prosjektet ha kjørt seg fast før det i det hele tatt var i gang. Fleksibiliteten var forutsetningen.

Advarselen: Datasjøen kan bli en sump

Her er fellen mange går i. Nettopp det som gjør en data lake kraftfull, at alt kan helles inn uten orden, gjør den farlig hvis den overlates til seg selv. Uten styring blir den fleksible innsjøen til en datasump: en uoversiktlig haug der ingen vet hva som finnes, hvor det kommer fra, eller om det er til å stole på.

To ting holder datasjøen sunn:

  • En katalog. Noe som beskriver hva datasjøen inneholder: hvilke data, hvor de kommer fra og hvilken stand de er i. Da kan dataene finnes og forstås.
  • Eierskap. Tydelig ansvar for de ulike datamengdene slik at noen står inne for kvaliteten og vet hvorfor de finnes.

Uten katalog og eierskap blir datasjøen ubrukelig akkurat når dere trenger den mest. Orden og ansvar er ikke byråkrati her, men forskjellen mellom en ressurs og en belastning.

Slik tar du neste steg

En data lake lønner seg når dere har store mengder variert data og reelle ambisjoner innen analyse eller AI, ikke som en trend dere hopper på. Når dere starter, bør dere planlegge for katalog og eierskap fra første dag, ikke som et lappverk i etterkant. Vil dere bygge et datagrunnlag som blir en ressurs og ikke en sump, tar vi i Weapp gjerne med dette i systemarbeidet fra begynnelsen.

Ofte stilte spørsmål

Hva er forskjellen på en data lake og et datavarehus?

En data lake lagrer rådata i originalformat og strukturerer dem først når de skal brukes. Et datavarehus (data warehouse) gjør det motsatte: Dataene ryddes og struktureres før de lagres. Grovt sagt strukturerer en data lake etter behov og et datavarehus på forhånd. En data lake er fleksibel og romslig, et datavarehus ordnet og klart til analyse. Mange større organisasjoner bruker begge sammen.

Hvorfor lagrer man rådata i originalformat?

For fleksibilitetens skyld. Når man lagrer alt slik det er, uten å bestemme på forhånd hvordan det skal brukes, låser man seg ikke til ett bestemt formål. Fremtidige spørsmål og analyser man ennå ikke har tenkt på, kan da besvares ut fra de samme dataene. Prisen er at dataene er uordnede til noen strukturerer dem når de skal brukes.

Hvorfor begynner AI- og analyseprosjekter ofte i en data lake?

Fordi slike prosjekter trenger mye og variert data og sjelden vet nøyaktig hva de trenger fra starten. En data lake kan ta imot alt i opprinnelig form, som logger, tekst, bilder og måleverdier, og gjøre det tilgjengelig for utforsking og modelltrening. Fleksibiliteten og kapasiteten passer godt for nettopp den eksperimenterende, datasultne fasen.

Hva menes med at en data lake blir en sump?

At den blir en uoversiktlig haug der ingen lenger vet hva som finnes, hvor det kommer fra, eller om det er til å stole på. Uten en katalog over innholdet og uten tydelig eierskap til dataene blir en fleksibel data lake til en datasump som ingen tør å bruke. Orden og ansvar er det som holder den brukbar.

Trenger alle virksomheter en data lake?

Nei. En data lake lønner seg først når dere har store mengder variert data og reelle behov innen analyse eller AI. For mindre organisasjoner med oversiktlige, stort sett strukturerte data kommer man langt med enklere løsninger, og en data lake blir mest en kostbar og vedlikeholdskrevende overbygning. Behovet, ikke trenden, bør avgjøre.