Hva er maskinlæring?
Maskinlæring er programmer som lærer seg å løse en oppgave ved å finne mønstre i data, i stedet for å følge regler som et menneske har skrevet for hånd. Du viser systemet mange eksempler med fasit, det generaliserer og kan deretter vurdere nye tilfeller det aldri har sett før.
Maskinlæring er programmer som lærer av eksempler i stedet for å følge regler noen har skrevet for hånd. Du viser systemet en stor mengde data der fasiten allerede er kjent, det finner mønstrene på egen hånd og kan deretter bruke dem på nye tilfeller. Det er teknologien som ligger bak det meste av det som i dag kalles AI.
Regelbasert kontra lært
Forskjellen blir tydeligst med et eksempel: et spamfilter. Den gamle, regelbaserte varianten bygde på regler et menneske skrev: Inneholder e-posten ordet «gratis», merk den som søppelpost. Slike regler blir fort et lappeteppe. Avsenderne bytter ord, skriver «gr4tis», og for hvert smutthull må noen skrive en ny regel. Systemet blir aldri ferdig.
Den lærte varianten snur dette på hodet. I stedet for regler legger du inn titusenvis av e-poster som allerede er merket som «søppelpost» eller «ikke søppelpost». Systemet regner selv ut hvilke mønstre som skiller de to haugene fra hverandre, ofte subtile kombinasjoner av ord, avsender og struktur som ikke noe menneske ville formulert. Når en ny e-post kommer inn, vurderer filteret hvor lik den er søppelposten det allerede har sett.
Poenget er at du aldri forteller hvordan e-posten skal vurderes. Du viser bare mange eksempler på riktig svar og lar systemet utlede regelen. Det er derfor maskinlæring passer for problemer der mønstrene er for mange, for foranderlige eller for vanskelige å gripe til å kunne skrives ned.
Hvordan AI, maskinlæring, dyp læring og LLM henger sammen
Begrepene blandes ofte sammen, men de ligger inni hverandre som russiske dukker. Fra det bredeste til det smaleste:
- AI er paraplyen: alt som får datamaskiner til å løse oppgaver som normalt krever menneskelig intelligens.
- Maskinlæring er den vanligste metoden for å bygge AI i dag: systemer som lærer av data i stedet for å programmeres med regler.
- Dyp læring er en gren av maskinlæring som bruker store nevrale nettverk med mange lag, særlig sterk på bilde, lyd og tekst.
- LLM (store språkmodeller) er en type dyp læring som er trent på enorme mengder tekst for å forstå og skape språk.
| Begrep | Kort forklaring |
|---|---|
| AI | Paraplyen for alle intelligente systemer |
| Maskinlæring | Systemer som lærer mønstre av data |
| Dyp læring | Maskinlæring med store nevrale nettverk |
| LLM | Dyp læring spesialisert på språk |
Så når noen sier at de «bruker AI», mener de nesten alltid maskinlæring i en eller annen form, og snakker de om verktøy av typen ChatGPT, handler det om en LLM innerst i dukken.
Hva som kreves for at det skal fungere
Maskinlæring er ikke magi. Tre ting må være på plass for at en modell skal gi verdi.
Data. Du trenger mange nok eksempler, og de må være relevante og riktig merket. En modell som skal vurdere kundehenvendelser, trenger ekte, historiske henvendelser med kjent utfall. Søppel inn gir søppel ut, uansett hvor avansert metoden er.
Et tydelig mål. Du må kunne formulere hva modellen skal forutsi eller avgjøre: Er dette søppelpost, hvilken kategori hører henvendelsen til, hvor stor blir etterspørselen neste uke? Et uklart mål gir en modell der ingen kan avgjøre om den lykkes.
Evaluering. Du holder tilbake en del av dataene som modellen aldri ser under treningen, og måler hvor godt den treffer på nettopp de eksemplene. Først da vet du om den har lært noe generelt eller bare pugget treningsdataene. Uten evaluering flyr du i blinde.
Et konkret regneeksempel
La oss si at en bedrift får 500 kundehenvendelser om dagen som skal sorteres til riktig avdeling. Historisk finnes det 50 000 ferdig sorterte henvendelser. De blir treningsdata: Teksten er inndata, og avdelingen er fasiten. Man holder tilbake 5 000 henvendelser til evaluering. Modellen trenes og viser seg å sortere riktig i 9 av 10 tilfeller på henvendelsene som ble holdt tilbake. Da kan den ta den første sorteringen automatisk, og de vanskelige tilfellene sendes videre til et menneske. Ingen har skrevet én eneste regel om hva henvendelsene handler om.
Det er den praktiske kjernen i maskinlæring: riktige data, et klart mål og ærlig måling. Vil du vite hvordan det kan tas i bruk hos dere, tar tjenestene våre innen AI og automatisering slike ideer fra use case til løsning i produksjon, med forvaltningen planlagt fra start.
Ofte stilte spørsmål
Hva er forskjellen på maskinlæring og vanlig programmering?
I vanlig programmering skriver en utvikler reglene: hvis dette, gjør dette. I maskinlæring skriver du ingen regler i det hele tatt. Du legger inn eksempler med fasit og lar systemet selv regne ut sammenhengene. Det gjør metoden sterk på problemer der reglene er for mange eller for uklare til å skrives ned.
Trenger jeg enorme mengder data for å komme i gang?
Det avhenger av oppgaven. Enkle problemer med tydelige mønstre kan fungere med noen tusen eksempler, mens bilde- og språkoppgaver ofte krever betydelig mer. Viktigere enn selve mengden er at dataene er relevante, riktig merket og gjenspeiler de tilfellene modellen skal møte i virkeligheten.
Er maskinlæring det samme som AI?
Nei, maskinlæring er en del av AI. AI er den brede paraplyen for systemer som løser oppgaver som normalt krever menneskelig intelligens. Maskinlæring er den vanligste metoden for å bygge slik AI i dag, og dyp læring og språkmodeller er i sin tur spesialtilfeller av maskinlæring.
Hvordan vet man at en modell faktisk er god?
Ved å måle den på data den ikke er trent på. Man holder tilbake en del av eksemplene som modellen aldri får se under treningen, og sjekker hvor ofte den svarer riktig på dem. Uten en slik uavhengig evaluering vet du bare at modellen har pugget, ikke at den generaliserer.
Kan en modell ta feil eller være partisk?
Ja. En modell lærer det som finnes i dataene, inkludert skjevheter og feil. Er grunnlaget ujevnt eller utdatert, arver modellen det. Derfor er gjennomgang av treningsdataene og løpende oppfølging av beslutningene en sentral del av ansvarlig maskinlæring, ikke noe man tar tak i etterpå.