Hvad koster det at drive en LLM-løsning?

Af Weapp · Opdateret

Driftsomkostningen for en LLM-løsning består af modelkald (pris pr. token), hosting og overvågning. En typisk samtale koster fra en øre eller to med en enklere model til nogle få DKK med en topmodel. Den samlede omkostning styres af volumen, modelvalg og promptlængde og kan ofte halveres med caching, batching og den rette model til hver opgave.

Udviklingsomkostningen for en AI-løsning er en engangspost. Driftsomkostningen følger med hver måned, og den skalerer med brugen. Alligevel er det driften der oftest mangler i kalkulerne. Denne side handler kun om det: hvad det koster at køre en LLM-løsning i produktion og hvordan du holder omkostningen nede.

Prisklasser pr. modelniveau 2026

Modelleverandørerne sætter pris pr. million tokens, med separate priser for input og output. De præcise priser ændrer sig hurtigt, men prisklassernes struktur har været stabil: Forskellen mellem den billigste og den dyreste klasse er cirka en faktor hundrede.

ModelniveauStørrelsesordenEgnet til
Lille/hurtig model~0,66–3,3 DKK pr. million tokensKlassificering, sortering, enkle omskrivninger, høj volumen
Mellemklassemodel~3,3–33 DKK pr. million tokensSvar i kundeservice, sammenfatninger, RAG-svar: arbejdshesten i de fleste løsninger
Topmodel~33–330 DKK pr. million tokensKompleks analyse, ræsonnement i flere trin, agentopgaver

Hvad betyder det pr. samtale? Antag en samtale i kundeservice med fem udvekslinger hvor hvert kald sender historik og vidensgrundlag med, f.eks. i alt 20.000 tokens ind og 2.000 ud for hele samtalen. Med en lille model koster samtalen nogle få øre, med en mellemklassemodel i størrelsesordenen 6,6–66 øre og med en topmodel nogle få DKK. Ved 10.000 samtaler om måneden bliver det forskellen mellem nogle hundrede DKK og titusindvis af DKK, for en ofte ligeværdig oplevet kvalitet på enkle henvendelser.

Tre optimeringer der gør størst forskel

  1. Caching af prompts. I de fleste løsninger er en stor del af hvert kald identisk: systeminstruktioner, eksempler, politiktekster. Leverandørernes prompt-caching giver kraftig rabat på genbrugt input; cachet input koster ofte kun en brøkdel af normalprisen. For løsninger med lange systemprompter er det den største enkeltstående besparelse.
  2. Den rette model til hvert trin. Lad ikke topmodellen gøre alt. En almindelig arkitektur lader en billig model klassificere og sortere mens den dyre model kun kobles på de sager der kræver den. At sende alle kald til den største model “for en sikkerheds skyld” er som at køre i lastbil til postkassen.
  3. Batching. Kald der ikke kræver svar i realtid, som natlige sammenfatninger, indeksering af dokumenter og kvalitetskontroller, kan køres som batch, hvilket hos flere leverandører halverer prisen.

Tilsammen kan de tre som regel sænke tokenomkostningen med 50–80 procent sammenlignet med en naiv implementering, uden mærkbart kvalitetstab.

Ud over de tre store findes der en fjerde vane der koster lidt og sparer meget: Hold konteksten kort. Mange løsninger sender af ren vane hele samtalehistorikken eller unødigt mange hentede dokumenter med i hvert kald. At skære det fra der ikke bidrager til svaret (opsummere historikken, begrænse antallet af kildeafsnit), sænker både omkostningen og svartiden og forbedrer ofte kvaliteten fordi modellen slipper for at lede i støj.

Byg en prognose før I skalerer

En driftsprognose behøver ikke at være avanceret, men den skal findes. Sådan bygger du den:

  • Mål omkostningen pr. interaktion i piloten. Ikke i teorien: Log det faktiske tokenforbrug pr. samtale eller sag i nogle uger.
  • Gang op med volumenscenarier. Regn på tre niveauer: forventet volumen, dobbelt volumen og tidobbelt volumen. Vokser omkostningen lineært, eller er der poster der eksploderer, f.eks. kontekst der vokser med historikken?
  • Læg de faste poster til. Hosting, vektordatabase, logning, overvågning og evalueringskørsler.
  • Sæt lofter og alarmer. Omkostningslofter pr. bruger og døgnalarmer på den samlede omkostning skal være på plads fra første dag i produktion. Ellers kan et fejlkonfigureret loop der kalder en topmodel, blive en dyr nat.

Bed også hver leverandør om at redegøre for antagelserne: hvilken model, hvilken promptlængde, hvilken volumen. Et tilbud uden driftskalkule er et halvt tilbud, og en prognose uden antagelser kan hverken efterprøves eller følges op når virkeligheden afviger.

Driften afgør arkitekturen

Den vigtigste beslutning for driftsomkostningen træffes ikke i driften, men i designet: modelvalg pr. trin, promptlængde, caching-strategi og muligheden for at skifte model når prisniveauet ændrer sig. Vi hos Weapp bygger AI-løsninger med opfølgning på omkostningerne som en del af leverancen. Kontakt os hvis du vil have hjælp til at lave en prognose for driftsomkostningen i jeres løsning eller til at sænke den.

Ofte stillede spørgsmål

Hvad er tokens?

Modellernes mindste tekstenheder, cirka orddele. En tommelfingerregel for dansk tekst er at et ord typisk bliver til flere tokens end på engelsk. Modelleverandørerne sætter pris pr. million tokens, med forskellig pris for input (det du sender ind) og output (det modellen skriver). Lange prompts og lange svar koster derfor mere.

Hvorfor blev vores LLM-faktura pludselig meget højere?

De mest almindelige årsager er voksende kontekst (historik der sendes med i hvert kald), flere kald pr. brugerinteraktion end planlagt, en opgradering til en dyrere model eller øget brug uden omkostningsloft. Sæt alarmer på de daglige omkostninger og budgetlofter pr. bruger fra dag ét, så opdages afvigelser med det samme.

Er det billigere selv at hoste en åben model?

Ved meget store volumener eller skrappe krav til data kan egen hosting betale sig, men GPU-servere, drift og kompetencer koster også. For de fleste virksomheder er API-modeller billigere samlet set indtil volumenerne er store og stabile. Regn på den samlede omkostning inklusive personale, ikke kun på prisen pr. token.

Falder tokenpriserne over tid?

Tendensen har været klart faldende priser for tilsvarende kapacitet samtidig med at nye topmodeller lanceres i højere prisklasser. Byg derfor løsningen så det er nemt at skifte model. Så kan I drage fordel af prisudviklingen i stedet for at sidde fast i gårsdagens prislap.

Hvad indgår ud over tokenomkostningen i LLM-drift?

Hosting af applikationen og en eventuel vektordatabase, logning og overvågning, evalueringskørsler der sikrer kvaliteten over tid samt drift og vedligeholdelse når modeller opdateres eller udskiftes. For mindre løsninger lander de faste driftsposter ofte på 3.200–21.000 DKK om måneden oven i tokenomkostningen.