Hvad er træningsdata?
Træningsdata er det eksempelmateriale en AI-model lærer mønstre af. Datakvaliteten sætter loftet for modellen: Lærer den af mangelfuldt eller skævt materiale, bliver svarene derefter. Man skelner mellem fortræning, der sker på enorme mængder tekst fra nettet, og finjustering på virksomhedens egne, mere specifikke eksempler. Rettighederne til dataene er et spørgsmål for sig.
Træningsdata er det eksempelmateriale en AI-model lærer mønstre af. Modellen “forstår” ikke noget i menneskelig forstand: Den opdager mønstre i det den er blevet fodret med, og gengiver dem. Derfor sætter datakvaliteten loftet for modellen. Lærer den af skævt eller mangelfuldt materiale, bliver svarene også skæve og mangelfulde.
Det gør træningsdata til en af de mest afgørende dele af en AI-løsning og samtidig en af de mest undervurderede. Det er let at fokusere på modellen og glemme at det er materialet den har lært af, der former hvad den kan.
Fortræning kontra virksomhedens egne eksempler
Der findes to helt forskellige skalaer af træning, og de bliver ofte blandet sammen.
Den første er fortræning. Her lærer modellen af enorme mængder generel tekst, ofte store dele af det der er offentligt tilgængeligt på nettet. Det giver den brede sproglige evner og generel viden: evnen til at skrive, ræsonnere og forstå sammenhænge. Det er et tungt og dyrt trin som udføres af dem der bygger grundmodellerne.
Den anden er finjustering på virksomhedens egne eksempler. Det er et langt mindre trin hvor en allerede trænet model trænes videre på et specifikt, udvalgt materiale for at blive styret mod en bestemt opgave eller tone. Her er det jeres data der former modellen efter netop jeres behov. Fortræningen bygger fundamentet; finjusteringen tilpasser det.
Skidt ind, skidt ud
Det vigtigste princip for træningsdata er gammelt, men stadig sandt: En model bliver aldrig bedre end de data den lærer af. Fodrer I den med rodet, forældet eller modstridende materiale, lærer modellen netop det og gengiver det i sine svar.
Et eksempel fra erhvervslivet gør det konkret. Lad os sige at I vil finjustere en model til at svare som jeres kundeservice. I træner den på flere års gemte svar. Men hvis de svar er inkonsekvente (forskellige medarbejdere har sagt forskellige ting, nogle er forældede og nogle direkte forkerte), så lærer modellen det rod. Resultatet bliver en model der selvsikkert giver gamle, modstridende svar. Ikke fordi teknologien er dårlig, men fordi materialet var det.
Konklusionen er enkel, men ofte ubekvem: Meget af arbejdet i et træningsprojekt ligger i at rydde op i, udvælge og kvalitetssikre data, ikke i selve træningen.
Mængde kontra kvalitet
Det er fristende at tro at flere data altid er bedre. I praksis hjælper mængde kun hvis kvaliteten er i orden.
| Datasæt | Typisk resultat |
|---|---|
| Stor mængde rodet materiale | Modellen overtager rodet |
| Mindre mængde rene, relevante data | Ofte et skarpere resultat |
Et mindre sæt rene, relevante og velvalgte data slår ofte en stor mængde rodet materiale. Ved finjustering er det vigtigere at eksemplerne er repræsentative og korrekte, end at de er mange. Kvalitet frem for kvantitet er et fornuftigt udgangspunkt.
Skæve data indebærer også en risiko der er værd at nævne. Afspejler materialet kun en del af virkeligheden, lærer modellen den skævhed. Træner I en model på eksempler der tilfældigvis mangler visse tilfælde, vil den præstere dårligere netop dér. At materialet er repræsentativt, altså at det dækker de situationer modellen faktisk skal håndtere, er derfor lige så vigtigt som at det er korrekt. En model bliver god til det den har set meget af, og usikker på resten.
Rettighederne til dataene
Ét spørgsmål bliver let glemt i begejstringen: Må I faktisk træne på de data I har tænkt jer at bruge? Personoplysninger, kundedata og materiale I har licenseret fra andre, kan have begrænsninger for hvordan de må bruges. At afklare det før træningen går i gang, er langt enklere end at opdage et problem når modellen allerede er bygget.
Det er også værd at skelne mellem træningsdata og det materiale en RAG-løsning henter. Træningsdata bages ind i modellen og sidder derefter fast; at opdatere dem kræver ny træning. RAG henter i stedet dokumenter ved hvert spørgsmål uden at røre modellen, hvilket gør viden let at skifte ud. For materiale der ændres ofte, er det tit en fordel slet ikke at træne det ind, men at hente det efter behov. Hvilken vej der passer, afhænger af hvor ofte materialet ændres og hvor meget I har brug for at kunne spore svarene til en kilde.
Træningsdata er altså ikke kun et teknisk spørgsmål, men lige så meget et spørgsmål om kvalitet og rettigheder. Vil du drøfte hvilket materiale der skulle til for en AI-løsning hos jer, kan du læse mere om vores AI-ydelser eller kontakte os med en beskrivelse af hvad modellen skal kunne.
Ofte stillede spørgsmål
Hvad er forskellen på fortræning og finjustering?
Fortræning sker på enorme mængder generel tekst, ofte fra nettet, og giver modellen dens brede sproglige evner. Finjustering er et senere, mindre trin hvor modellen trænes videre på virksomhedens egne, specifikke eksempler for at styre den mod en bestemt opgave eller tone. Fortræningen bygger fundamentet, finjusteringen former det efter jeres behov.
Hvad betyder skidt ind, skidt ud?
At en model aldrig bliver bedre end de data den lærer af. Træner I en model på inkonsekvent, forældet eller forkert materiale, lærer den de mangler og gengiver dem i sine svar. En kundeservicemodel der er trænet på gamle, modstridende svar, vil give netop gamle, modstridende svar. Datakvaliteten sætter altså loftet for hvor godt resultatet kan blive.
Må vi træne en AI-model på vores egne data?
Det afhænger af hvad dataene indeholder og hvilke rettigheder I har til dem. Personoplysninger, kundedata og materiale I har licenseret fra andre, kan have begrænsninger for hvordan de må bruges. Før I træner på data, skal I afklare at I faktisk må, både juridisk og i henhold til eventuelle aftaler. Det er et spørgsmål der skal afklares tidligt, ikke bagefter.
Giver flere data altid et bedre resultat?
Nej. Mængde hjælper kun hvis kvaliteten er i orden. Et mindre sæt rene, relevante og velvalgte data giver ofte et bedre resultat end en stor mængde rodet materiale. Ved finjustering er det ofte vigtigere at eksemplerne er repræsentative og korrekte, end at de er mange. Kvalitet frem for kvantitet er et fornuftigt udgangspunkt.
Er træningsdata det samme som det RAG henter?
Nej. Træningsdata bages ind i modellen gennem træning og sidder derefter fast. Det RAG henter, er dokumenter der hentes ind ved hvert enkelt spørgsmål uden at modellen ændres. Forskellen betyder noget for hvordan I opdaterer viden: Nye træningsdata kræver ny træning mens RAG-materiale kan skiftes ud med det samme ved at opdatere dokumenterne.