Hva koster det å drifte en LLM-løsning?
Driftskostnaden for en LLM-løsning består av modellkall (pris per token), hosting og overvåking. En typisk samtale koster fra noen få øre med en enklere modell til noen kroner med en toppmodell. Totalkostnaden styres av volum, modellvalg og promptlengde. Den kan ofte halveres med caching, batching og riktig modell per oppgave.
Utviklingskostnaden for en AI-løsning er en engangspost. Driftskostnaden kommer hver måned, og den skalerer med bruken. Likevel er det driften som oftest mangler i kalkylene. Denne siden handler bare om det: hva det koster å kjøre en LLM-løsning i produksjon, og hvordan du holder kostnaden nede.
Prisklasser per modellnivå i 2026
Leverandørene prissetter modellene per million tokens, med separate priser for inndata og utdata. De eksakte prisene endrer seg raskt, men prisklassene har vært stabile i strukturen: Forskjellen mellom den billigste og den dyreste klassen er omtrent en faktor hundre.
| Modellnivå | Størrelsesorden | Egnet for |
|---|---|---|
| Liten/rask modell | ~0,96–4,8 kr per million tokens | Klassifisering, sortering, enkle omskrivinger, høyt volum |
| Mellomklassemodell | ~4,8–48 kr per million tokens | Svar i kundeservice, oppsummeringer, RAG-svar: arbeidshesten i de fleste løsninger |
| Toppmodell | ~48–480 kr per million tokens | Kompleks analyse, resonnering i flere steg, agentoppgaver |
Hva betyr det per samtale? Anta en kundeservicesamtale med fem runder der hvert kall sender med historikk og kunnskapsgrunnlag, for eksempel totalt 20 000 tokens inn og 2 000 ut for hele samtalen. Med en liten modell koster samtalen noen få øre, med en mellomklassemodell i størrelsesorden 9,6–96 øre, og med en toppmodell noen kroner. Ved 10 000 samtaler i måneden blir det forskjellen mellom noen hundrelapper og titusenvis av kroner, for ofte likeverdig opplevd kvalitet på enkle henvendelser.
Tre optimaliseringer som gir størst effekt
- Caching av prompter. I de fleste løsninger er en stor del av hvert kall identisk: systeminstruksjoner, eksempler, policytekster. Leverandørenes prompt-caching gir kraftig rabatt på gjenbrukte inndata, og inndata som hentes fra cachen, koster ofte en brøkdel av ordinær pris. For løsninger med lange systemprompter er dette den største enkeltbesparelsen.
- Riktig modell per steg. La ikke toppmodellen gjøre alt. En vanlig arkitektur lar en billig modell klassifisere og sortere, mens den dyre modellen bare kobles inn på sakene som krever den. Å sende alle kall til den største modellen «for sikkerhets skyld» er som å kjøre lastebil til postkassen.
- Batching. Kall som ikke trenger svar i sanntid, som nattlige oppsummeringer, dokumentindeksering og kvalitetskontroller, kan kjøres som batch, noe som halverer prisen hos flere leverandører.
Sammen kan disse tre ofte redusere tokenkostnaden med 50–80 prosent sammenlignet med en naiv implementering, uten merkbart kvalitetstap.
I tillegg til de tre store finnes det en fjerde vane som koster lite og sparer mye: Hold konteksten kort. Mange løsninger sender rutinemessig med hele samtalehistorikken eller unødvendig mange hentede dokumenter i hvert kall. Å trimme bort det som ikke bidrar til svaret (oppsummere historikken, begrense antallet kildeavsnitt), reduserer både kostnaden og responstiden og forbedrer ofte kvaliteten fordi modellen slipper å lete i støy.
Lag en prognose før dere skalerer
En driftsprognose trenger ikke å være avansert, men den må finnes. Slik lager du den:
- Mål kostnaden per interaksjon i piloten. Ikke i teorien: Logg det faktiske tokenforbruket per samtale eller sak over noen uker.
- Multipliser med volumscenarioer. Regn på tre nivåer: forventet volum, dobbelt volum og ti ganger volumet. Vokser kostnaden lineært, eller finnes det poster som eksploderer, som kontekst som vokser med historikken?
- Legg til de faste postene. Hosting, vektordatabase, logging, overvåking og evalueringskjøringer.
- Sett tak og varsler. Kostnadstak per bruker og døgnvarsel på totalkostnaden skal være på plass fra første dag i produksjon. En feilkonfigurert løkke som kaller en toppmodell, kan ellers bli en dyr natt.
Be også hver leverandør om å gjøre rede for antakelsene: hvilken modell, hvilken promptlengde, hvilket volum. Et tilbud uten driftskalkyle er et halvt tilbud, og en prognose uten antakelser kan verken kontrolleres eller følges opp når virkeligheten avviker.
Driften avgjør arkitekturen
Den viktigste beslutningen for driftskostnaden tas ikke i driften, men i designet: modellvalg per steg, promptlengde, caching-strategi og muligheten til å bytte modell når prisnivået endrer seg. Vi i Weapp bygger AI-løsninger med kostnadsoppfølging som en del av leveransen. Ta kontakt hvis dere vil ha hjelp til å anslå eller redusere driftskostnaden for løsningen deres.
Ofte stilte spørsmål
Hva er en token?
Modellenes minste tekstenhet, omtrent en orddel. Norske ord blir ofte delt opp i flere tokens enn engelske. Leverandørene tar betalt per million tokens, med ulik pris for inndata (det du sender inn) og utdata (det modellen skriver). Lange prompter og lange svar koster derfor mer.
Hvorfor ble LLM-fakturaen vår plutselig mye høyere?
De vanligste årsakene er voksende kontekst (historikk som sendes med i hvert kall), flere kall per brukerinteraksjon enn planlagt, en oppgradering til en dyrere modell eller økt bruk uten kostnadstak. Sett opp varsler på daglige kostnader og budsjettak per bruker fra dag én, så oppdages avvik med en gang.
Er det billigere å hoste en åpen modell selv?
Ved svært høye volumer eller strenge krav til dataene kan egen hosting lønne seg, men GPU-servere, drift og kompetanse koster også. For de fleste virksomheter er API-modeller billigere totalt sett helt til volumene er store og stabile. Regn på totalkostnaden inkludert personale, ikke bare på prisen per token.
Synker tokenprisene over tid?
Trenden har vært tydelig fallende priser for tilsvarende kapasitet, samtidig som nye toppmodeller lanseres i høyere prisklasser. Bygg derfor løsningen slik at det er enkelt å bytte modell. Da kan dere dra nytte av prisutviklingen i stedet for å sitte fast med gårsdagens prislapp.
Hva inngår i LLM-drift utover tokenkostnaden?
Hosting av applikasjonen og eventuell vektordatabase, logging og overvåking, evalueringskjøringer som sikrer kvaliteten over tid, og forvaltning når modeller oppdateres eller byttes ut. For mindre løsninger havner de faste driftspostene ofte på 3 700–25 000 kr i måneden i tillegg til tokenkostnaden.