LLM via API eller self-hosted model?

Af Weapp · Opdateret

API er det rigtige udgangspunkt for de fleste: ingen GPU-drift, ingen MLOps-organisation og altid aktuelle modeller mod en variabel pris pr. token. Self-hosting begrundes først og fremmest med datafortrolighed, regulatoriske krav eller meget høje volumener, men kræver GPU-kapacitet, driftskompetencer og løbende vedligeholdelse af modeller, og det koster ofte mere end API-gebyrerne.

Bag spørgsmålet om hvilken model der er bedst, ligger et større: Skal I leje intelligensen via et API, eller skal I selv eje driften med en åben model? Valget styrer omkostningsniveau, kompetencebehov og kontrol i flere år frem, og det afgøres sjældent af teknikken, men af jeres volumener og jeres krav til data.

Hvad valget egentlig står mellem

Via et API betaler I pr. token: Leverandøren driver modellen, skalerer kapaciteten og opgraderer løbende. Self-hosting betyder at I kører en åben model på egen infrastruktur, med egne eller lejede GPU’er, og ejer hele kæden fra drift til modelvalg.

Det lyder som et økonomisk spørgsmål, og det er det til dels. Men den reelle skillelinje går ved ansvaret: Med et API køber I et resultat, med egen drift bygger I en kompetence. Kompetencen er værdifuld, men kun hvis den bliver brugt til noget. At bygge den for dens egen skyld er den dyreste måde at køre en model på.

Den reelle omkostning ved self-hosting

Regnestykket for egen drift bliver næsten altid undervurderet, for det kan ikke ses på en prisliste. Tre poster dominerer:

  • GPU-kapacitet. Dedikerede GPU-instanser til seriøs drift koster ofte titusindvis af DKK om måneden, og klynger til større modeller eller redundans det mangedobbelte. Kapaciteten koster desuden døgnet rundt, uanset belastning.
  • MLOps-kompetencer. Idriftsættelse, skalering, overvågning, sikkerhed og håndtering af hændelser kræver specialistviden der er dyr at rekruttere og svær at erstatte ved fravær.
  • Vedligeholdelse af modeller. Åbne modeller udgives i højt tempo. Evaluering, skift og regressionstest er et tilbagevendende arbejde, ikke en engangsindsats.
OmkostningspostVia APISelf-hosted
Brug af modellenPris pr. tokenGPU-drift døgnet rundt
Drift og skaleringInkluderetEgen MLOps-organisation
OpgraderingerLøbende fra leverandørenEget arbejde med evaluering og skift
Kontrol over dataStyret af aftalenFysisk: Data forlader aldrig jeres miljø

Én post mere bliver ofte glemt: tiden til første nytte. En API-integration kan være i produktion på få dage mens et eget driftsmiljø måles i måneder, og forsinkelsen har også en pris.

Regneeksempel: når API-gebyrerne vinder

En virksomhed bygger en intern assistent der bruges et par hundrede gange om dagen. Via et API bliver den månedlige udgift en variabel post der følger brugen. Ved den volumen er den typisk en brøkdel af hvad en enkelt dedikeret GPU-server koster om måneden før der er brugt en eneste krone på drift eller personale.

Ved meget høje og jævne volumener kan regnestykket vende: Når API-gebyrerne stabilt overstiger hvad den tilsvarende kapacitet koster i egen regi, begynder egen drift at kunne betale sig forudsat at kompetencerne allerede findes i huset. Tommelfingerreglen: Regn på jeres faktiske volumenprofil med aktuelle prislister, og regn dobbelt så grundigt på personaleomkostningen som på hardwaren.

Grundene der alligevel driver self-hosting

Nogle gange er regnestykket sekundært. Tre motiver vejer tungest:

  • Datafortrolighed: Data forlader aldrig jeres miljø. Ingen aftale i verden er stærkere end slet ikke at sende data af sted.
  • Regulering: Visse organisationer har krav om at behandlingen sker i egen infrastruktur, i yderste konsekvens helt uden internetforbindelse.
  • Uafhængighed: Ingen ekstern part kan udfase jeres model, ændre vilkårene eller hæve prisen.

Bemærk at der findes mellemveje, f.eks. EU-baserede GPU-clouds og administrerede tjenester til åbne modeller, som giver dele af kontrollen uden hele driftsbyrden. Og lad jura og sikkerhed formulere kravet sammen i stedet for at tage det for givet: Nogle gange viser analysen at en API-løsning med behandling i EU og den rette aftale opfylder kravene til en brøkdel af omkostningen.

Kapacitetsgabet i 2026, og hvornår det er ligegyldigt

Åbne modeller ligger i 2026 stadig efter de bedste API-modeller i bred, generel formåen, især i lange ræsonnementer og komplekse agentflows. Men til afgrænsede opgaver er gabet ofte irrelevant: Klassificering, udtræk, intern søgning og opsummering med facit klarer velvalgte åbne modeller fremragende. Gabet er desuden en ferskvare. Revurder det pr. opgave og år i stedet for at gøre det til en trossag.

Det gør analysen af opgaven til det egentlige beslutningsgrundlag. En skarpt afgrænset opgave plus stærke krav til fortrolighed taler for egen drift; bred, varieret brug taler for API. Evaluer kandidaterne på jeres egne data før I beslutter jer, og byg med et abstraktionslag så beslutningen kan ændres. Hos Weapp hjælper vi virksomheder med at lave netop den analyse i deres AI-satsninger. Kontakt os hvis du vil regne på jeres tilfælde.

Ofte stillede spørgsmål

Hvad koster det at self-hoste en LLM?

Det afhænger af modellens størrelse og kravene til oppetid. Regn med tre poster: GPU-kapacitet, som til seriøs drift ofte koster titusindvis af DKK om måneden og opefter, MLOps-kompetencer til drift og skalering samt løbende arbejde med modelskift og evaluering. Den samlede omkostning ender ofte langt over API-gebyrerne for den samme nytte.

Er en self-hosted model automatisk mere sikker i forhold til GDPR?

Nej. Den giver kontrol, men flytter hele ansvaret over på jer: adgangsstyring, logning, patching og håndtering af hændelser. En velkonfigureret API-løsning med behandling i EU og en stærk aftale kan være lettere at forsvare end egen drift uden sikkerhedsressourcer.

Hvilke åbne modeller er relevante?

Modelfamilier som Llama og Mistral er almindelige udgangspunkter, og udvalget vokser hurtigt. Hvilken der passer, afhænger af licensvilkår, sprogunderstøttelse og opgavetype. Evaluer på jeres egne data, og tjek licensen i forhold til den brug I har tænkt jer.

Kan vi starte med API og flytte til egen drift senere?

Ja, det er den mest almindelige og som regel klogeste vej. Byg et abstraktionslag mellem jeres applikation og modellen fra start, så bliver flytningen et infrastrukturprojekt i stedet for en omskrivning, og beslutningen kan vente til volumen eller krav begrunder den.

Kræver fine-tuning at vi selv hoster modellen?

Nej, flere API-leverandører tilbyder fine-tuning som tjeneste. Egen drift bliver først relevant når I har brug for fuld kontrol over vægtene, f.eks. af fortrolighedshensyn eller til specialiserede modeller. For de fleste rækker promptarbejde og fine-tuning via API langt.