Vad kostar det att driva en LLM-lösning?

Av Weapp · Uppdaterad

Driftkostnaden för en LLM-lösning består av modellanrop (pris per token), hosting och övervakning. En typisk konversation kostar från något öre med en enklare modell till några kronor med en toppmodell. Totalkostnaden styrs av volym, modellval och promptlängd — och kan ofta halveras med caching, batching och rätt modell per uppgift.

Utvecklingskostnaden för en AI-lösning är en engångspost — driftkostnaden följer med varje månad, och den skalar med användningen. Ändå är det driften som oftast saknas i kalkylerna. Den här sidan handlar bara om det: vad det kostar att köra en LLM-lösning i produktion, och hur du håller kostnaden nere.

Prisklasser per modellnivå 2026

Modellleverantörerna prissätter per miljon tokens, med separata priser för indata och utdata. Exakta priser rör sig snabbt, men prisklasserna har varit stabila i sin struktur — skillnaden mellan billigaste och dyraste klass är ungefär en faktor hundra.

ModellnivåStorleksordningPassar för
Liten/snabb modell~1–5 kr per miljon tokensKlassificering, sortering, enkla omskrivningar, hög volym
Mellanklassmodell~5–50 kr per miljon tokensKundtjänstsvar, sammanfattningar, RAG-svar — arbetshästen i de flesta lösningar
Toppmodell~50–500 kr per miljon tokensKomplex analys, flerstegs resonemang, agentuppgifter

Vad betyder det per konversation? Anta en kundtjänstkonversation på fem utbyten där varje anrop skickar med historik och kunskapsunderlag — säg totalt 20 000 tokens in och 2 000 ut för hela konversationen. Med en liten modell kostar konversationen några ören, med en mellanklassmodell i storleksordningen 10 öre–1 kr, och med en toppmodell några kronor. Vid 10 000 konversationer i månaden blir det skillnaden mellan några hundralappar och tiotusentals kronor — för ofta likvärdig upplevd kvalitet på enkla ärenden.

Tre optimeringar som gör störst skillnad

  1. Caching av prompts. I de flesta lösningar är en stor del av varje anrop identiskt: systeminstruktioner, exempel, policytexter. Leverantörernas prompt-caching ger kraftig rabatt på återanvänd indata — ofta är cachad indata en bråkdel av ordinarie pris. För lösningar med långa systemprompter är detta den enskilt största besparingen.
  2. Rätt modell per steg. Låt inte toppmodellen göra allt. En vanlig arkitektur låter en billig modell klassificera och sortera, medan den dyra modellen bara kopplas in på de ärenden som kräver den. Att skicka alla anrop till största modellen “för säkerhets skull” är som att köra lastbil till brevlådan.
  3. Batching. Anrop som inte behöver svar i realtid — nattliga sammanfattningar, dokumentindexering, kvalitetskontroller — kan köras som batch, vilket hos flera leverantörer halverar priset.

Tillsammans brukar de här tre kunna sänka tokenkostnaden med 50–80 procent jämfört med en naiv implementation, utan märkbar kvalitetsförlust.

Utöver de tre stora finns en fjärde vana som kostar lite och sparar mycket: håll kontexten kort. Många lösningar skickar slentrianmässigt med hela konversationshistoriken eller onödigt många hämtade dokument i varje anrop. Att trimma bort det som inte bidrar till svaret — sammanfatta historik, begränsa antalet källavsnitt — sänker både kostnad och svarstid, och förbättrar ofta kvaliteten eftersom modellen slipper leta i brus.

Bygg en prognos innan ni skalar

En driftprognos behöver inte vara avancerad, men den behöver finnas. Så här bygger du den:

  • Mät kostnad per interaktion i piloten. Inte i teorin — logga faktisk tokenförbrukning per konversation eller ärende under några veckor.
  • Multiplicera med volymscenarier. Räkna på tre nivåer: förväntad volym, dubbel volym och tio gångers volym. Växer kostnaden linjärt, eller finns det poster som exploderar — som kontext som växer med historiken?
  • Lägg till de fasta posterna. Hosting, vektordatabas, loggning, övervakning och utvärderingskörningar.
  • Sätt tak och larm. Kostnadstak per användare och dygnslarm på totalkostnad ska finnas från första produktionsdagen. En felkonfigurerad loop som anropar en toppmodell kan annars bli en dyr natt.

Be också varje leverantör redovisa antaganden: vilken modell, vilken promptlängd, vilken volym. En offert utan driftkalkyl är en halv offert — och en prognos utan antaganden går varken att granska eller följa upp när verkligheten avviker.

Driften avgör arkitekturen

Det viktigaste beslutet för driftkostnaden fattas inte i driften utan i designen: modellval per steg, promptlängd, caching-strategi och möjligheten att byta modell när prisbilden ändras. Vi på Weapp bygger AI-lösningar med kostnadsuppföljning som en del av leveransen — hör av dig om du vill ha hjälp att prognostisera eller sänka driftkostnaden för er lösning.

Vanliga frågor

Vad är en token?

Modellernas minsta textenhet — ungefär en ordbit. En tumregel för svenska är att ett ord blir 1,5–2 tokens. Modellleverantörer prissätter per miljon tokens, med olika pris för indata (det du skickar in) och utdata (det modellen skriver). Långa prompts och långa svar kostar därför mer.

Varför blev vår LLM-faktura plötsligt mycket högre?

De vanligaste orsakerna är växande kontext (historik som skickas med i varje anrop), fler anrop per användarinteraktion än tänkt, en uppgradering till dyrare modell eller ökad användning utan kostnadstak. Sätt larm på dagliga kostnader och budgettak per användare från dag ett, så upptäcks avvikelser direkt.

Är det billigare att hosta en öppen modell själv?

Vid mycket höga volymer eller hårda datakrav kan egen hosting löna sig, men GPU-servrar, drift och kompetens kostar också. För de flesta svenska bolag är API-modeller billigare totalt sett tills volymerna är stora och stabila. Räkna på totalkostnaden inklusive personal, inte bara på priset per token.

Sjunker tokenpriserna över tid?

Trenden har varit tydligt fallande priser för motsvarande kapacitet, samtidigt som nya toppmodeller lanseras i högre prisklasser. Bygg därför lösningen så att modellbyte är enkelt — då kan ni dra nytta av prisutvecklingen i stället för att sitta fast i gårdagens prislapp.

Vad mer än tokenkostnad ingår i LLM-drift?

Hosting av applikation och eventuell vektordatabas, loggning och övervakning, utvärderingskörningar som säkrar kvaliteten över tid samt förvaltning när modeller uppdateras eller byts ut. För mindre lösningar landar de fasta driftposterna ofta på 3 000–20 000 kr i månaden utöver tokenkostnaden.