Hvad er inferens i AI?

Af Weapp · Opdateret

Inferens er den fase hvor en AI-model køres, altså hver gang den besvarer et spørgsmål. Den står i modsætning til træningsfasen, hvor modellen blev bygget. For virksomheder er det den omkostning der tæller fordi man næsten altid bruger en færdig model og betaler pr. kørsel. Omkostningen styres af modellens størrelse, mængden af tokens og kravene til svartid.

Inferens er den fase hvor en AI-model køres: selve det øjeblik hvor den modtager et spørgsmål og producerer et svar. Den står i modsætning til træningsfasen, hvor modellen engang blev bygget ved at lære mønstre ud fra data. Træningen er fremstillingen; inferensen er brugen.

Forskellen er vigtig, for den forklarer hvor omkostningen faktisk havner for de fleste virksomheder. Ordet inferens betyder omtrent “at drage en slutning”: Modellen drager en slutning ud fra det den har lært og det du spørger om. Hvert svar den giver, er en inferens.

Træningsomkostning kontra driftsomkostning

De to faser adskiller sig dramatisk fra hinanden i både karakter og omkostning.

Træning er et tungt engangsarbejde. At bygge en grundmodel fra bunden kræver enorme mængder data og regnekraft og udføres af få store aktører. Det er ekstremt dyrt, men det sker én gang.

Inferens er den løbende drift. Hver gang nogen stiller et spørgsmål, køres modellen, og hver kørsel koster et lille beløb. Beløbet er lavt, men det ganges op med hver eneste brug.

For en typisk virksomhed er konsekvensen tydelig: I træner sjældent jeres egen grundmodel, men bruger en færdig. Derfor betaler I i praksis næsten udelukkende for inferens, altså for at køre modellen, ikke for at bygge den. Det er inferensomkostningen der dukker op i budgettet, og som er værd at forstå.

Hvad der driver inferensomkostningen

Tre faktorer afgør hvad hver kørsel koster, og de kan påvirkes.

  • Modelstørrelse. En større, kraftigere model koster mere pr. kørsel end en mindre. At vælge den største model der findes, når en mindre er nok, er en almindelig og dyr fejl.
  • Antal tokens. Omkostningen beregnes pr. token, altså pr. tekststump der sendes ind og genereres. Lange spørgsmål, meget medsendt historik og udførlige svar trækker omkostningen op.
  • Svartid. Krav om meget hurtige svar kan kræve flere ressourcer og dermed øge omkostningen.
OmkostningsdriverEffekt på regningen
Større modelHøjere omkostning pr. kørsel
Flere tokens pr. spørgsmålOmkostningen stiger proportionalt
Krav om hurtige svarKan kræve flere ressourcer

Pointen er at inferensomkostningen ikke er et fast tal, men noget der formes af hvordan løsningen bygges. At vælge den rigtige model til opgaven og begrænse mængden af tekst der sendes, er ofte det der påvirker mest.

Et konkret regneeksempel

Forestil dig en intern AI-assistent der besvarer spørgsmål fra medarbejderne. Hvert spørgsmål er en inferens: En vis mængde tokens sendes ind (spørgsmålet plus eventuel historik og medsendt materiale), og en vis mængde genereres som svar. Omkostningen pr. spørgsmål er lille, men med hundredvis af spørgsmål om dagen bliver summen mærkbar over en måned.

Her ses hvorfor optimering betaler sig. Sender I hele den tidligere samtale med ved hvert spørgsmål, vokser antallet af tokens hurtigt, og omkostningen med dem. Vælger I desuden en unødvendigt stor model, betaler I et tillæg for kapacitet I ikke bruger. Ved at vælge en passende model og kun sende det materiale med som spørgsmålet faktisk har brug for, kan den samme tjeneste blive betydeligt billigere at drive uden at svarene bliver dårligere. Det er sjældent én stor besparelse, men snarere mange små der tæller pr. token.

Hvor inferensen køres

Til sidst: Inferens kan køres på to måder. Enten via et API i skyen, hvor I kalder en leverandørs model og betaler efter forbrug, eller på egen hardware som I selv drifter. Skyen er nemmest at komme i gang med og skalerer med brugen mens egen hardware kan betale sig ved store, stabile volumener eller når data ikke må forlade jeres systemer.

Valget mellem sky og egen hardware er sjældent oplagt, men snarere en afvejning. Skyen kræver ingen investering i udstyr og passer til de fleste der er ved at komme i gang, men omkostningen følger brugen og kan blive høj ved meget store volumener. Egen hardware betyder en investering på forhånd og drift der skal passes, men kan blive billigere pr. kørsel når volumen er stor og stabil, og giver fuld kontrol over hvor data behandles. Det er samme slags afvejning som mellem at leje og at eje.

At forstå inferens er at forstå hvor pengene går hen i en AI-løsning, og dermed hvor der kan spares. Vil du drøfte hvad drift af en model ville koste i jeres tilfælde, kan du læse mere om vores AI-ydelser eller kontakte os med en beskrivelse af den forventede brug.

Ofte stillede spørgsmål

Hvad er forskellen på træning og inferens?

Træning er når modellen bygges og lærer mønstre ud fra data, et tungt engangsarbejde. Inferens er når den færdige model bruges til at besvare et spørgsmål, igen og igen i drift. Træningen udføres én gang af dem der bygger modellen; inferensen sker hver gang nogen stiller den et spørgsmål. De fleste virksomheder berøres kun af inferensen.

Hvorfor betaler virksomheder næsten kun for inferens?

Fordi de fleste bruger en færdig model i stedet for at træne deres egen. Træningen af grundmodeller er ekstremt dyr og udføres af få aktører. I stedet betaler I for at køre den færdige model, for hvert spørgsmål den besvarer. Derfor er det inferensomkostningen, ikke træningsomkostningen, der ses i budgettet for en typisk AI-løsning.

Hvad påvirker inferensomkostningen?

Primært tre ting. Modelstørrelsen: En større model koster mere pr. kørsel. Mængden af tokens: Jo mere tekst der sendes ind og genereres, desto højere bliver omkostningen. Og kravene til svartid: Hurtigere svar kan kræve flere ressourcer. At vælge den rigtige modelstørrelse til opgaven, i stedet for den største der findes, er ofte det der påvirker omkostningen mest.

Hvor køres inferens?

Enten via et API i skyen, hvor I kalder en leverandørs model og betaler efter forbrug, eller på egen hardware som I selv drifter. Skyen er nemmest at komme i gang med og skalerer med brugen. Egen hardware kan betale sig ved store, stabile volumener eller når data af fortrolighedshensyn ikke må forlade jeres systemer. Valget afhænger af volumen, omkostning og krav.

Kan inferensomkostningen sænkes?

Ofte ja. Almindelige greb er at vælge en mindre model hvor den er tilstrækkelig, at forkorte det der sendes ind, og at undgå at sende mere historik med end nødvendigt ved hvert spørgsmål. Man kan også mindske antallet af kørsler ved at gemme og genbruge svar på spørgsmål der går igen. Fordi omkostningen beregnes pr. token, får den slags optimeringer direkte effekt på regningen.