LLM via API eller självhostad modell?
API är rätt utgångspunkt för de flesta: ingen GPU-drift, ingen MLOps-organisation och alltid aktuella modeller mot en rörlig kostnad per token. Självhostning motiveras främst av datasekretess, regulatoriska krav eller mycket höga volymer – men kräver GPU-kapacitet, driftkompetens och löpande modellunderhåll som ofta kostar mer än API-avgifterna.
Bakom frågan om vilken modell som är bäst ligger en större: ska ni hyra intelligensen via ett API eller äga driften själva med en öppen modell? Valet styr kostnadsbild, kompetensbehov och kontroll under flera år framåt – och det avgörs sällan av tekniken, utan av era volymer och era krav på data.
Vad valet faktiskt står mellan
Via API betalar ni per token: leverantören driftar modellen, skalar kapaciteten och uppgraderar löpande. Självhostat innebär att ni kör en öppen modell på egen infrastruktur – egna eller hyrda GPU:er – och äger hela kedjan från drift till modellval.
Det låter som en ekonomisk fråga, och delvis är den det. Men den verkliga skiljelinjen går vid ansvar: med API köper ni ett resultat, med egen drift bygger ni en förmåga. Förmågan är värdefull – men bara om den används till något; att bygga den för dess egen skull är det dyraste sättet att köra en modell.
Den verkliga kostnaden för självhostning
Kalkylen för egen drift underskattas nästan alltid, för den syns inte på en prislista. Tre poster dominerar:
- GPU-kapacitet. Dedikerade GPU-instanser för seriös drift kostar ofta tiotusentals kronor i månaden – och kluster för större modeller eller redundans mångdubbelt mer. Kapaciteten kostar dessutom dygnet runt, oavsett last.
- MLOps-kompetens. Driftsättning, skalning, övervakning, säkerhet och incidenthantering kräver specialistkunskap som är dyr att rekrytera och svår att ersätta vid frånvaro.
- Modellunderhåll. Öppna modeller släpps i högt tempo. Utvärdering, byten och regressionstester är ett återkommande arbete, inte en engångsinsats.
| Kostnadspost | Via API | Självhostad |
|---|---|---|
| Modellanvändning | Pris per token | GPU-drift dygnet runt |
| Drift och skalning | Ingår | Egen MLOps-organisation |
| Uppgraderingar | Löpande från leverantören | Eget utvärderings- och bytesarbete |
| Kontroll över data | Avtalsstyrd | Fysisk – data lämnar aldrig er miljö |
En post till glöms ofta: tiden till första nytta. En API-integration kan vara i produktion på dagar, medan en egen driftmiljö mäts i månader – och fördröjningen har också ett pris.
Räkneexempel: när API-avgifterna vinner
Ett bolag bygger en intern assistent som används några hundra gånger per dag. Via API blir månadskostnaden en rörlig post som följer användningen – vid den volymen typiskt en bråkdel av vad en enda dedikerad GPU-server kostar per månad, innan en enda krona lagts på drift eller personal.
Vid mycket höga och jämna volymer kan kalkylen vända: när API-avgifterna stadigt överstiger vad motsvarande kapacitet kostar i egen regi börjar egen drift löna sig – förutsatt att kompetensen redan finns i huset. Tumregeln: räkna på er faktiska volymprofil med aktuella prislistor, och räkna personalkostnaden dubbelt så noga som hårdvaran.
Skälen som ändå driver självhostning
Ibland är kalkylen sekundär. Tre motiv väger tyngst:
- Datasekretess: data lämnar aldrig er miljö – inget avtal i världen är starkare än att inte skicka datan alls.
- Regulatorik: vissa verksamheter har krav på att behandling sker i egen infrastruktur, i extremfallet helt utan internetuppkoppling.
- Oberoende: ingen extern part kan fasa ut er modell, ändra villkoren eller höja priset.
Notera att det finns mellanvägar – EU-baserade GPU-moln och hanterade tjänster för öppna modeller – som ger delar av kontrollen utan hela driftsbördan. Och låt juridik och säkerhet formulera kravet tillsammans i stället för att anta det: ibland visar analysen att en EU-behandlad API-lösning med rätt avtal uppfyller kraven till en bråkdel av kostnaden.
Kapacitetsgapet 2026 – och när det inte spelar roll
Öppna modeller ligger 2026 fortfarande efter de bästa API-modellerna i bred, generell förmåga – särskilt i långa resonemang och komplexa agentflöden. Men för avgränsade uppgifter är gapet ofta irrelevant: klassificering, extraktion, intern sökning och sammanfattning med facit klarar väl valda öppna modeller utmärkt. Gapet är dessutom en färskvara – omvärdera det per uppgift och år, inte som en trosuppfattning.
Det gör uppgiftsanalysen till det verkliga beslutsunderlaget. En skarp avgränsad uppgift plus starka sekretesskrav talar för egen drift; bred, varierad användning talar för API. Utvärdera kandidaterna på era egna data innan ni bestämmer er – och bygg med ett abstraktionslager så att beslutet går att ändra. Vi på Weapp hjälper företag att göra just den analysen i sina AI-satsningar – hör av dig om du vill räkna på ert fall.
Vanliga frågor
Vad kostar det att självhosta en LLM?
Det beror på modellstorlek och tillgänglighetskrav. Räkna med tre poster: GPU-kapacitet som för seriös drift ofta kostar tiotusentals kronor i månaden och uppåt, MLOps-kompetens för drift och skalning, samt löpande arbete med modellbyten och utvärdering. Totalkostnaden landar ofta långt över API-avgifterna för samma nytta.
Är en självhostad modell automatiskt säkrare för GDPR?
Nej, den ger kontroll men flyttar hela ansvaret till er: åtkomststyrning, loggning, patchning och incidenthantering. En välkonfigurerad API-lösning med EU-behandling och starkt avtal kan vara enklare att försvara än en egen drift utan säkerhetsresurser.
Vilka öppna modeller är aktuella?
Modellfamiljer som Llama och Mistral är vanliga utgångspunkter, och utbudet växer snabbt. Vilken som passar beror på licensvillkor, språkstöd och uppgiftstyp – utvärdera på era egna data och kontrollera licensen mot er tänkta användning.
Kan vi börja med API och flytta till egen drift senare?
Ja, det är den vanligaste och oftast klokaste vägen. Bygg ett abstraktionslager mellan er applikation och modellen från start, så blir flytten ett infrastrukturprojekt i stället för en omskrivning – och beslutet kan vänta tills volymen eller kraven motiverar det.
Kräver finjustering att vi hostar själva?
Nej, flera API-leverantörer erbjuder finjustering som tjänst. Egen drift blir aktuell först när ni behöver full kontroll över vikterna, till exempel av sekretesskäl eller för specialiserade modeller – för de flesta räcker prompt-arbete och API-finjustering långt.