RAG eller fine-tuning for AI-løsningen?

Av Weapp · Oppdatert

Grunnregelen er enkel: Velg RAG når modellen trenger kunnskap fra dokumentene deres, og fine-tuning når den skal endre atferd, tone eller format. RAG holdes oppdatert ved at dokumentene oppdateres, mens fine-tuning krever en ny treningsrunde ved hver endring. Mange løsninger ender i en kombinasjon, men det billige første steget er alltid prompt engineering.

Når en språkmodell skal kunne innholdet deres, finnes det to etablerte veier: RAG, der modellen henter fra kildene deres i det øyeblikket den svarer, og fine-tuning, der modellen trenes videre på eksemplene deres. Valget fremstilles ofte som en teknologibeslutning. Det er det ikke. Det er en beslutning om hva problemet egentlig er: kunnskap eller atferd.

Grunnregelen: kunnskap til RAG, atferd til fine-tuning

RAG (Retrieval-Augmented Generation) lar modellen slå opp relevante dokumenter, som retningslinjer, produktark og avtaler, og svare ut fra dem. Det er riktig verktøy når problemet er at modellen ikke vet det den skal svare på: sortimentet deres, vilkårene deres, den nyeste prislisten.

Fine-tuning trener en eksisterende modell videre på eksemplene deres til den endrer måten den svarer på: tonalitet, svarstruktur, formatdisiplin, domenespesifikke konvensjoner. Det er riktig verktøy når modellen vet nok, men oppfører seg feil: svarer for langt, bommer på formatet deres, bryter med stilen deres.

Tommelfingerregelen holder overraskende godt: Handler klagen på modellen om hva den sier, er det et kunnskapsproblem. Velg RAG. Handler den om hvordan den sier det, er det et atferdsproblem. Vurder fine-tuning.

Kostnad og vedlikehold: den avgjørende forskjellen

Byggekostnaden er forskjellig, men den virkelige forskjellen ligger i vedlikeholdslogikken.

En RAG-løsning oppdateres med dokumenter. Endrer dere en retningslinje eller legger til et produkt, indekseres det nye innholdet, og modellen svarer riktig ved neste spørsmål, uten trening og uten ny versjon. Prisen er i stedet en pipeline som skal bygges og driftes: kilder, opprydding, indeksering og søkekvalitet. Regn med at en betydelig del av budsjettet går til å få orden på innholdet heller enn på AI-teknologien.

Fine-tuning betaler dere for per syklus: samle inn og kvalitetssikre treningseksempler, kjøre treningen, evaluere resultatet og gjøre alt sammen på nytt når innholdet, kravene eller grunnmodellen endres. En finjustert modell er ferskvare med utgivelsesdato. Det er håndterbart når atferden den har lært, er stabil over tid, og dyrt når det dere har trent inn, endres ofte.

SammenligningspunktRAG og fine-tuning
Løser bestRAG: kunnskap fra kildene deres. Fine-tuning: tone, format og atferd.
OppdateringRAG: bytt dokumenter, ferdig. Fine-tuning: ny treningsrunde med evaluering.
SporbarhetRAG: svar kan vise til kilder. Fine-tuning: vanskelig å vise hvorfor modellen svarer som den gjør.
KostnadsprofilRAG: pipeline og drift per spørsmål. Fine-tuning: kostnad per treningssyklus.
Passer nårRAG: innholdet endres fortløpende. Fine-tuning: atferdskravet er stabilt.

Trappen: Start billig, trapp opp med bevis

Den dyreste feilen i metodevalget er å begynne i feil ende. Rekkefølgen som holder kostnaden nede:

  1. Prompt engineering. En gjennomarbeidet prompt med instruksjoner og eksempler. Timer til dager med arbeid, ingen infrastruktur. Løser flere problemer enn ryktet tilsier.
  2. RAG. Når modellen trenger kunnskap som prompten ikke har plass til. Krever pipeline og kildearbeid, men gir oppdaterbarhet og kildehenvisninger.
  3. Fine-tuning. Når atferdskravene beviselig ikke nås med prompt og RAG. Krever treningsdata, en evalueringssuite og en plan for ny trening.
  4. Kombinasjonen. RAG for kunnskapen, fine-tuning for atferden, ofte endestasjonen for løsninger med høye krav til både korrekthet og form.

Hvert steg tas bare når det forrige beviselig har nådd taket, målt på reelle eksempler, ikke på magefølelse.

Et scenario: supportboten i tre steg

En bedrift bygger en supportassistent. Versjon én er en modell styrt med prompt. Den svarer hyggelig, men gjetter på produktdetaljer. Versjon to kobler på RAG mot produktdokumentasjon og vilkår: Svarene blir korrekte og viser til kilder, og når prislisten oppdateres, svarer boten riktig samme dag. Gjenstående problem: Svarene spriker i form, med noen ganger tre avsnitt, noen ganger en punktliste og noen ganger feil hilsen. Versjon tre finjusteres på noen hundre eksempler på perfekte svar. Kunnskapen kommer fortsatt fra RAG-løsningen, mens formatet sitter i modellen.

Hadde de begynt med fine-tuning, hadde de bakt inn en prisliste som var utdatert en måned senere, og betalt for ny trening ved hver endring. Rekkefølgen avgjorde økonomien. Vi i Weapp bygger AI-løsninger etter nettopp den trappen. Ta kontakt hvis dere vil ha hjelp til å avgjøre hvor løsningen deres bør begynne.

Ofte stilte spørsmål

Kan man kombinere RAG og fine-tuning?

Ja, og modne løsninger ender ofte der: RAG gir modellen oppdatert kunnskap fra kildene deres, mens fine-tuning finpusser tone, format og atferdsmønstre som skal sitte i hvert svar. Metodene løser ulike problemer og konkurrerer egentlig ikke. De utfyller hverandre.

Blir svarene mer korrekte med fine-tuning?

Sjelden på den måten man håper. Fine-tuning lærer modellen mønstre og stil, men er svak som kunnskapslag: Innbakte fakta blir utdatert og kan ikke knyttes til en kilde. Må modellen svare riktig ut fra innholdet deres, er henting fra en oppdatert kilde via RAG nesten alltid riktig verktøy.

Når er prompt engineering nok?

Oftere enn de fleste tror. En gjennomarbeidet systemprompt med instruksjoner, eksempler og relevant kontekst dekker mange behov for tone, format og enklere kunnskap, uten infrastruktur. Begynn der, mål kvaliteten, og gå videre til RAG eller fine-tuning først når prompten beviselig har nådd taket.

Hva koster RAG sammenlignet med fine-tuning?

En RAG-løsning koster normalt 370 000 kr–1,9 millioner kr å bygge, der opprydding i dataene ofte er den største posten, pluss lav driftskostnad per spørsmål. Ved fine-tuning ligger kostnaden i datainnsamling, treningskjøringer og evaluering, og den kommer igjen ved hver ny trening. Spennene styres av tilstanden til kildene og kvalitetskravene.

Hvordan holder vi løsningen oppdatert over tid?

Med RAG oppdaterer dere innholdet: nye dokumenter inn, gamle ut, og modellen svarer straks ut fra det nye. Med fine-tuning kreves nye treningsdata, en ny treningsrunde og ny evaluering ved hver vesentlig endring. Regn på endringstakten i innholdet deres. Den avgjør ofte metodevalget alene.