Hva er inferens?

Av Weapp · Oppdatert

Inferens er kjørefasen for en AI-modell, altså hver gang den besvarer et spørsmål. Det står i kontrast til treningsfasen, da modellen ble bygget. For virksomheter er dette kostnaden som teller fordi man nesten alltid bruker en ferdig modell og betaler per kjøring. Kostnaden styres av modellstørrelse, mengden tokens og krav til responstid.

Inferens er kjørefasen for en AI-modell, selve øyeblikket da den tar imot et spørsmål og produserer et svar. Det står i kontrast til treningsfasen, da modellen en gang ble bygget ved å lære mønstre fra data. Treningen er produksjonen, og inferensen er bruken.

Forskjellen er viktig, for den forklarer hvor kostnaden faktisk havner for de fleste virksomheter. Ordet inferens betyr omtrent «å trekke en slutning»: Modellen trekker en slutning ut fra det den har lært og det du spør om. Hvert svar den gir, er en inferens.

Treningskostnad kontra driftskostnad

De to fasene skiller seg dramatisk fra hverandre i både karakter og kostnad.

Trening er et tungt engangsarbeid. Å bygge en grunnmodell fra bunnen av krever enorme mengder data og regnekraft, og det gjøres av noen få store aktører. Det er ekstremt kostbart, men det skjer én gang.

Inferens er den løpende driften. Hver gang noen stiller et spørsmål, kjøres modellen, og det koster en liten sum hver gang. Summen er lav per kjøring, men ganges med hver eneste bruk.

For en typisk virksomhet er konsekvensen tydelig: Dere trener sjelden en egen grunnmodell, men bruker en ferdig. Derfor betaler dere i praksis nesten utelukkende for inferens, for å kjøre modellen, ikke for å bygge den. Det er inferenskostnaden som dukker opp i budsjettet, og som er verdt å forstå.

Hva som driver inferenskostnaden

Tre faktorer avgjør hva hver kjøring koster, og de kan påvirkes.

  • Modellstørrelse. En større, kraftigere modell koster mer per kjøring enn en mindre. Å velge den største modellen som finnes når en mindre holder, er en vanlig og dyr feil.
  • Antall tokens. Kostnaden beregnes per token, altså per tekstbit som sendes inn og genereres. Lange spørsmål, mye medsendt historikk og utførlige svar driver opp kostnaden.
  • Responstid. Krav om svært raske svar kan kreve mer ressurser og dermed øke kostnaden.
KostnadsdriverEffekt på regningen
Større modellHøyere kostnad per kjøring
Flere tokens per spørsmålKostnaden stiger proporsjonalt
Krav om raske svarKan kreve mer ressurser

Poenget er at inferenskostnaden ikke er et fast tall, men noe som formes av hvordan løsningen bygges. Å velge riktig modell for oppgaven og begrense mengden tekst som sendes, er ofte det som betyr mest.

Et konkret regneeksempel

Tenk deg en intern AI-assistent som besvarer spørsmål fra de ansatte. Hvert spørsmål innebærer en inferens: En viss mengde tokens sendes inn, altså spørsmålet pluss eventuell historikk og medsendt grunnlag, og en viss mengde genereres som svar. Kostnaden per spørsmål er liten, men med hundrevis av spørsmål om dagen blir summen merkbar over en måned.

Her ser man hvorfor optimalisering lønner seg. Sender dere med hele den tidligere samtalen ved hvert spørsmål, vokser antallet tokens raskt, og kostnaden med dem. Velger dere i tillegg en unødvendig stor modell, betaler dere et påslag for kapasitet dere ikke bruker. Ved å velge en passende modell og bare sende med grunnlaget spørsmålet faktisk trenger, kan den samme tjenesten bli betydelig billigere å drive, uten at svarene blir dårligere. Det er sjelden én stor besparelse, men mange små som summerer seg per token.

Hvor inferensen kjøres

Til slutt: Inferens kan kjøres på to måter. Enten via et API i skyen, der dere kaller en leverandørs modell og betaler per bruk, eller på egen maskinvare som dere drifter selv. Skyen er enklest å komme i gang med og skalerer med bruken, mens egen maskinvare kan lønne seg ved store, jevne volumer eller når data ikke får forlate egne systemer.

Valget mellom sky og egen maskinvare er sjelden opplagt. Det er en avveiing. Skyen krever ingen investering i utstyr og passer de fleste i startfasen, men kostnaden følger bruken og kan bli høy ved svært store volumer. Egen maskinvare innebærer en investering på forhånd og drift som må håndteres, men kan bli billigere per kjøring når volumet er stort og jevnt, og gir full kontroll over hvor dataene behandles. Det er samme type avveiing som mellom å leie og å eie.

Å forstå inferens er å forstå hvor pengene går i en AI-løsning, og dermed hvor det er mulig å spare. Vil du drøfte hva drift av en modell ville koste i deres tilfelle, kan du lese mer om AI-tjenestene våre eller ta kontakt med en beskrivelse av forventet bruk.

Ofte stilte spørsmål

Hva er forskjellen mellom trening og inferens?

Trening er når modellen bygges og lærer mønstre fra data, et tungt engangsarbeid. Inferens er når den ferdige modellen brukes til å svare på et spørsmål, om og om igjen i drift. Treningen gjøres én gang av dem som bygger modellen, mens inferensen skjer hver gang noen stiller den et spørsmål. De fleste virksomheter berøres bare av inferensen.

Hvorfor betaler virksomheter nesten bare for inferens?

Fordi de fleste bruker en ferdig modell i stedet for å trene sin egen. Treningen av grunnmodeller er ekstremt kostbar og gjøres av noen få aktører. I stedet betaler dere for å kjøre den ferdige modellen, for hvert spørsmål den besvarer. Derfor er det inferenskostnaden, ikke treningskostnaden, som vises i budsjettet for en typisk AI-løsning.

Hva påvirker inferenskostnaden?

Først og fremst tre ting. Modellstørrelsen: En større modell koster mer per kjøring. Mengden tokens: Jo mer tekst som sendes inn og genereres, desto høyere kostnad. Og kravene til responstid: Raskere svar kan kreve mer ressurser. Å velge riktig modellstørrelse for oppgaven, i stedet for den største som finnes, er ofte det som påvirker kostnaden mest.

Hvor kjøres inferens?

Enten via et API i skyen, der dere kaller en leverandørs modell og betaler per bruk, eller på egen maskinvare som dere drifter selv. Skyen er enklest å komme i gang med og skalerer med bruken. Egen maskinvare kan lønne seg ved store, jevne volumer eller når data er så sensitive at de ikke får forlate egne systemer. Valget avhenger av volum, kostnad og krav.

Kan inferenskostnaden senkes?

Ofte ja. Vanlige grep er å velge en mindre modell der det holder, korte ned det som sendes inn, og unngå å sende med mer historikk enn nødvendig ved hvert spørsmål. Også det å lagre og gjenbruke svar på spørsmål som går igjen, kan redusere antallet kjøringer. Fordi kostnaden beregnes per token, får slike optimaliseringer direkte effekt på regningen.