Hva er treningsdata?

Av Weapp · Oppdatert

Treningsdata er eksempelmaterialet en AI-modell lærer mønstre av. Kvaliteten på dataene setter taket for modellen: Lærer den av mangelfullt eller skjevt materiale, blir svarene deretter. Man skiller mellom forhåndstrening, som skjer på enorme mengder tekst fra nettet, og finjustering på virksomhetens egne, mer spesifikke eksempler. Rettighetene til dataene er et spørsmål for seg.

Treningsdata er eksempelmaterialet en AI-modell lærer mønstre av. Modellen «forstår» ingenting i menneskelig forstand. Den oppdager mønstre i det den er blitt matet med, og gjengir dem. Derfor setter kvaliteten på dataene taket for modellen: Lærer den av skjevt eller mangelfullt materiale, blir også svarene skjeve og mangelfulle.

Det gjør treningsdata til en av de mest avgjørende delene av en AI-løsning, og samtidig en av de mest undervurderte. Det er lett å fokusere på modellen og glemme at det er materialet den har lært av, som former hva den kan.

Forhåndstrening kontra virksomhetens egne eksempler

Det finnes to helt ulike skalaer av trening, og de blandes ofte sammen.

Den første er forhåndstrening. Her lærer modellen av enorme mengder generell tekst, ofte store deler av det som er offentlig tilgjengelig på nettet. Det gir den bred språkevne og generell kunnskap: evnen til å skrive, resonnere og forstå sammenhenger. Det er et tungt og kostbart steg som gjøres av dem som bygger grunnmodellene.

Den andre er finjustering på virksomhetens egne eksempler. Det er et mye mindre steg der en modell som allerede er trent, trenes videre på et spesifikt, utvalgt materiale for å styres mot en bestemt oppgave eller tone. Her er det deres data som former modellen etter nettopp deres behov. Forhåndstreningen legger grunnlaget; finjusteringen tilpasser det.

Søppel inn, søppel ut

Det viktigste prinsippet for treningsdata er gammelt, men fortsatt sant: En modell blir aldri bedre enn dataene den lærer av. Mater dere inn rotete, utdatert eller motstridende materiale, lærer modellen nettopp det og gjengir det i svarene.

Et eksempel fra forretningslivet gjør det konkret. La oss si at dere vil finjustere en modell til å svare slik kundeservicen deres gjør. Dere trener den på flere års lagrede svar. Men hvis svarene er inkonsekvente (ulike medarbeidere har sagt ulike ting, noen svar er utdaterte og noen er direkte feil), lærer modellen seg rotet. Resultatet blir en modell som selvsikkert gir gamle, motstridende svar. Ikke fordi teknologien er dårlig, men fordi materialet var det.

Konklusjonen er enkel, men ofte ubehagelig: Mye av arbeidet i et treningsprosjekt ligger i å rydde, velge ut og kvalitetssikre data, ikke i selve treningen.

Mengde kontra kvalitet

Det er fristende å tro at mer data alltid er bedre. I praksis hjelper mengde bare hvis kvaliteten holder.

DatasettTypisk resultat
Stor mengde rotete materialeModellen lærer seg rotet
Mindre mengde rene, relevante dataOfte et skarpere resultat

Et mindre sett med rene, relevante og godt utvalgte data slår ofte en stor mengde rotete materiale. For finjustering er det viktigere at eksemplene er representative og korrekte enn at de er mange. Kvalitet fremfor kvantitet er et fornuftig utgangspunkt.

Det er også verdt å nevne en risiko ved skjeve data. Gjenspeiler materialet bare en del av virkeligheten, lærer modellen seg den skjevheten. Trener dere en modell på eksempler som tilfeldigvis mangler visse tilfeller, kommer den til å prestere dårligere nettopp der. At materialet er representativt, altså at det dekker situasjonene modellen faktisk skal håndtere, er derfor like viktig som at det er korrekt. En modell blir god på det den har sett mye av, og usikker på resten.

Rettighetene til dataene

Ett spørsmål blir lett glemt i entusiasmen: Har dere faktisk lov til å trene på dataene dere har tenkt å bruke? Personopplysninger, kundedata og materiale dere har lisensiert fra andre, kan ha begrensninger for hvordan de får brukes. Å avklare dette før treningen starter, er langt enklere enn å oppdage et problem når modellen allerede er bygget.

Det er også verdt å skille treningsdata fra grunnlaget en RAG-løsning henter. Treningsdata bakes inn i modellen og sitter deretter fast; å oppdatere dem krever ny trening. RAG henter i stedet dokumenter ved hvert spørsmål uten å røre modellen, og det gjør kunnskapen enkel å bytte ut. For grunnlag som endres ofte, er det ofte en fordel å ikke trene det inn i det hele tatt, men hente det ved behov. Hvilken vei som passer, avhenger av hvor ofte materialet endres, og hvor mye dere trenger å kunne spore svarene tilbake til en kilde.

Treningsdata er altså ikke bare et teknisk spørsmål, men like mye et spørsmål om kvalitet og rettigheter. Vil du diskutere hvilket materiale som trengs for en AI-løsning hos dere, kan du lese mer om AI-tjenestene våre eller ta kontakt med en beskrivelse av hva modellen skal klare.

Ofte stilte spørsmål

Hva er forskjellen mellom forhåndstrening og finjustering?

Forhåndstrening skjer på enorme mengder generell tekst, ofte fra nettet, og gir modellen en bred språkevne. Finjustering er et senere, mindre steg der modellen trenes videre på virksomhetens egne, spesifikke eksempler for å styre den mot en bestemt oppgave eller tone. Forhåndstreningen legger grunnlaget, finjusteringen former det etter behovet deres.

Hva betyr søppel inn, søppel ut?

At en modell aldri blir bedre enn dataene den lærer av. Trener dere en modell på inkonsekvent, utdatert eller feilaktig materiale, lærer den seg manglene og gjengir dem i svarene. En kundeservicemodell som er trent på gamle, motstridende svar, kommer til å gi nettopp gamle, motstridende svar. Datakvaliteten setter altså taket for hvor godt resultatet kan bli.

Har vi lov til å trene en AI-modell på våre egne data?

Det avhenger av hva dataene inneholder, og hvilke rettigheter dere har til dem. Personopplysninger, kundedata og materiale dere har lisensiert fra andre, kan ha begrensninger for hvordan de får brukes. Før dere trener på data, må dere avklare at dere faktisk har lov til det, både juridisk og etter eventuelle avtaler. Det er et spørsmål som må avklares tidlig, ikke i etterkant.

Gir mer data alltid et bedre resultat?

Nei. Mengde hjelper bare hvis kvaliteten holder. Et mindre sett med rene, relevante og godt utvalgte data gir ofte et bedre resultat enn en stor mengde rotete materiale. For finjustering er det ofte viktigere at eksemplene er representative og korrekte enn at de er mange. Kvalitet fremfor kvantitet er et fornuftig utgangspunkt.

Er treningsdata det samme som det RAG henter?

Nei. Treningsdata bakes inn i modellen gjennom trening og sitter deretter fast. Det RAG henter, er dokumenter som plukkes ut ved hvert enkelt spørsmål, uten at modellen endres. Forskjellen betyr noe for hvordan dere oppdaterer kunnskap: Nye treningsdata krever ny trening, mens RAG-grunnlaget kan byttes ut med en gang ved at dokumentene oppdateres.