LLM via API eller selvhostet modell?

Av Weapp · Oppdatert

API er riktig utgangspunkt for de fleste: ingen GPU-drift, ingen MLOps-organisasjon og alltid oppdaterte modeller mot en variabel kostnad per token. Selvhosting begrunnes først og fremst med konfidensialitet, regulatoriske krav eller svært høye volumer, men krever GPU-kapasitet, driftskompetanse og løpende modellvedlikehold som ofte koster mer enn API-avgiftene.

Bak spørsmålet om hvilken modell som er best, ligger et større: Skal dere leie intelligensen via et API eller eie driften selv med en åpen modell? Valget styrer kostnadsnivå, kompetansebehov og kontroll i flere år fremover, og det avgjøres sjelden av teknologien, men av volumene deres og kravene dere har til data.

Hva valget egentlig står mellom

Via API betaler dere per token: Leverandøren drifter modellen, skalerer kapasiteten og oppgraderer fortløpende. Selvhostet betyr at dere kjører en åpen modell på egen infrastruktur, med egne eller leide GPU-er, og eier hele kjeden fra drift til modellvalg.

Det høres ut som et økonomisk spørsmål, og delvis er det det. Men det egentlige skillet handler om ansvar: Med API kjøper dere et resultat, med egen drift bygger dere en evne. Evnen er verdifull, men bare hvis den brukes til noe. Å bygge den for dens egen skyld er den dyreste måten å kjøre en modell på.

Den reelle kostnaden ved selvhosting

Regnestykket for egen drift undervurderes nesten alltid fordi det ikke står på noen prisliste. Tre poster dominerer:

  • GPU-kapasitet. Dedikerte GPU-instanser for seriøs drift koster ofte titusenvis av kroner i måneden, og klynger for større modeller eller redundans mange ganger mer. Kapasiteten koster dessuten døgnet rundt, uansett belastning.
  • MLOps-kompetanse. Produksjonssetting, skalering, overvåking, sikkerhet og hendelseshåndtering krever spesialistkunnskap som er dyr å rekruttere og vanskelig å erstatte ved fravær.
  • Modellvedlikehold. Åpne modeller slippes i høyt tempo. Evaluering, bytter og regresjonstester er et tilbakevendende arbeid, ikke en engangsinnsats.
KostnadspostVia APISelvhostet
ModellbrukPris per tokenGPU-drift døgnet rundt
Drift og skaleringInkludertEgen MLOps-organisasjon
OppgraderingerFortløpende fra leverandørenEget evaluerings- og byttearbeid
Kontroll over dataStyrt av avtaleFysisk (dataene forlater aldri miljøet deres)

Enda en post blir ofte glemt: tiden før løsningen gir nytte. En API-integrasjon kan være i produksjon på dager, mens et eget driftsmiljø måles i måneder, og forsinkelsen har også en pris.

Regneeksempel: når API-avgiftene vinner

En bedrift bygger en intern assistent som brukes noen hundre ganger per dag. Via API blir månedskostnaden en variabel post som følger bruken, og ved det volumet typisk en brøkdel av hva én eneste dedikert GPU-server koster per måned før én krone er brukt på drift eller personale.

Ved svært høye og jevne volumer kan regnestykket snu: Når API-avgiftene stabilt overstiger hva tilsvarende kapasitet koster i egen regi, begynner egen drift å lønne seg. Det forutsetter at kompetansen allerede finnes i huset. Tommelfingerregelen: Regn på den faktiske volumprofilen deres med gjeldende prislister, og regn på personalkostnaden dobbelt så nøye som på maskinvaren.

Grunnene som likevel driver selvhosting

Noen ganger er regnestykket sekundært. Tre motiver veier tyngst:

  • Konfidensialitet: Dataene forlater aldri miljøet deres. Ingen avtale i verden er sterkere enn å ikke sende dataene i det hele tatt.
  • Regulatoriske krav: Enkelte virksomheter har krav om at behandlingen skjer i egen infrastruktur, i ytterste konsekvens helt uten internettilkobling.
  • Uavhengighet: Ingen ekstern part kan fase ut modellen deres, endre vilkårene eller øke prisen.

Merk at det finnes mellomløsninger, for eksempel EU-baserte GPU-skyer og administrerte tjenester for åpne modeller. De gir deler av kontrollen uten hele driftsbyrden. Og la juristene og de sikkerhetsansvarlige formulere kravet sammen i stedet for å anta det: Noen ganger viser analysen at en API-løsning med behandling i EU og riktig avtale oppfyller kravene til en brøkdel av kostnaden.

Kapasitetsgapet i 2026, og når det ikke spiller noen rolle

Åpne modeller ligger i 2026 fortsatt etter de beste API-modellene i bred, generell evne, særlig i lange resonnementer og komplekse agentflyter. Men for avgrensede oppgaver er gapet ofte irrelevant: Klassifisering, ekstraksjon, internt søk og oppsummering med fasit klarer godt valgte åpne modeller utmerket. Gapet er dessuten ferskvare. Vurder det på nytt per oppgave og år, ikke som en trosoppfatning.

Det gjør oppgaveanalysen til det egentlige beslutningsgrunnlaget. En skarpt avgrenset oppgave kombinert med sterke konfidensialitetskrav taler for egen drift, mens bred, variert bruk taler for API. Evaluer kandidatene på egne data før dere bestemmer dere, og bygg med et abstraksjonslag slik at beslutningen kan endres. Vi i Weapp hjelper virksomheter med nettopp den analysen i AI-satsingene deres. Ta kontakt hvis dere vil regne på deres tilfelle.

Ofte stilte spørsmål

Hva koster det å selvhoste en LLM?

Det avhenger av modellstørrelse og krav til oppetid. Regn med tre poster: GPU-kapasitet, som for seriøs drift ofte koster titusenvis av kroner i måneden og oppover, MLOps-kompetanse for drift og skalering, og løpende arbeid med modellbytter og evaluering. Totalkostnaden ender ofte langt over API-avgiftene for samme nytte.

Er en selvhostet modell automatisk tryggere med tanke på GDPR?

Nei, den gir kontroll, men flytter hele ansvaret over på dere: tilgangsstyring, logging, patching og hendelseshåndtering. En godt konfigurert API-løsning med behandling i EU og en sterk avtale kan være lettere å forsvare enn egen drift uten sikkerhetsressurser.

Hvilke åpne modeller er aktuelle?

Modellfamilier som Llama og Mistral er vanlige utgangspunkter, og utvalget vokser raskt. Hvilken som passer, avhenger av lisensvilkår, språkstøtte og oppgavetype. Evaluer på egne data, og kontroller lisensen mot bruken dere planlegger.

Kan vi starte med API og flytte til egen drift senere?

Ja, det er den vanligste og som regel klokeste veien. Bygg et abstraksjonslag mellom applikasjonen og modellen fra start, så blir flyttingen et infrastrukturprosjekt i stedet for en omskriving. Da kan beslutningen vente til volumet eller kravene tilsier det.

Krever finjustering at vi drifter modellen selv?

Nei, flere API-leverandører tilbyr finjustering som tjeneste. Egen drift blir først aktuell når dere trenger full kontroll over vektene, for eksempel av konfidensialitetshensyn eller for spesialiserte modeller. De fleste kommer langt med promptarbeid og finjustering via API.