Vad är inferens?
Inferens är körningsfasen för en AI-modell – varje gång den besvarar en fråga. Det står i kontrast till träningsfasen, då modellen byggdes. För företag är detta den kostnad som räknas, eftersom man nästan alltid använder en färdig modell och betalar per körning. Kostnaden styrs av modellstorlek, mängd tokens och krav på svarstid.
Inferens är körningsfasen för en AI-modell – själva ögonblicket då den tar emot en fråga och producerar ett svar. Det står i kontrast till träningsfasen, då modellen en gång byggdes genom att lära sig mönster ur data. Träningen är tillverkningen; inferensen är användningen.
Skillnaden är viktig, för den förklarar var kostnaden faktiskt hamnar för de flesta företag. Ordet inferens betyder ungefär “att dra en slutsats” – modellen drar en slutsats utifrån det den lärt sig och det du frågar om. Varje svar den ger är en inferens.
Träningskostnad kontra driftskostnad
De två faserna skiljer sig dramatiskt åt i både karaktär och kostnad.
Träning är ett tungt engångsarbete. Att bygga en grundmodell från grunden kräver enorma mängder data och beräkningskraft, och görs av ett fåtal stora aktörer. Det är extremt kostsamt, men det sker en gång.
Inferens är den löpande driften. Varje gång någon ställer en fråga körs modellen, och det kostar en liten summa per gång. Summan är låg per körning men multipliceras med varje användning.
För ett typiskt företag är konsekvensen tydlig: ni tränar sällan en egen grundmodell, utan använder en färdig. Därför betalar ni i praktiken nästan uteslutande för inferens – för att köra modellen, inte för att bygga den. Det är inferenskostnaden som dyker upp i budgeten och som är värd att förstå.
Vad som driver inferenskostnaden
Tre faktorer avgör vad varje körning kostar, och de går att påverka.
- Modellstorlek. En större, kraftfullare modell kostar mer per körning än en mindre. Att välja den största modellen som finns, när en mindre räcker, är ett vanligt och dyrt misstag.
- Antal tokens. Kostnaden räknas per token, alltså per textbit som skickas in och genereras. Långa frågor, mycket medskickad historik och utförliga svar driver upp kostnaden.
- Svarstid. Krav på mycket snabba svar kan kräva mer resurser och därmed öka kostnaden.
| Kostnadsdrivare | Effekt på notan |
|---|---|
| Större modell | Högre kostnad per körning |
| Fler tokens per fråga | Kostnaden stiger proportionellt |
| Krav på snabba svar | Kan kräva mer resurser |
Poängen är att inferenskostnaden inte är en fast siffra utan något som formas av hur lösningen byggs. Att välja rätt modell för uppgiften och hålla nere mängden text som skickas är ofta det som påverkar mest.
Ett konkret räkneexempel
Tänk en intern AI-assistent som besvarar frågor från personalen. Varje fråga innebär en inferens: en viss mängd tokens skickas in – frågan plus eventuell historik och medskickat underlag – och en viss mängd genereras som svar. Kostnaden per fråga är liten, men med hundratals frågor om dagen blir summan påtaglig över en månad.
Här syns varför optimering lönar sig. Skickar ni med hela den tidigare konversationen vid varje fråga växer antalet tokens snabbt, och kostnaden med dem. Väljer ni dessutom en onödigt stor modell betalar ni ett påslag för kapacitet ni inte använder. Genom att välja en lagom modell och bara skicka med det underlag frågan faktiskt behöver kan samma tjänst bli avsevärt billigare att driva – utan att svaren blir sämre. Det är sällan en enda stor besparing, utan många små som räknas per token.
Var inferensen körs
Slutligen: inferens kan köras på två sätt. Antingen via ett API i molnet, där ni anropar en leverantörs modell och betalar per användning, eller på egen hårdvara som ni driftar själva. Molnet är enklast att komma igång med och skalar med användningen, medan egen hårdvara kan löna sig vid stora, jämna volymer eller när data inte får lämna era system.
Valet mellan moln och egen hårdvara är sällan självklart, utan en avvägning. Molnet kräver ingen investering i utrustning och passar de flesta som börjar, men kostnaden följer användningen och kan bli hög vid mycket stora volymer. Egen hårdvara innebär en investering upp front och drift att sköta, men kan bli billigare per körning när volymen är stor och jämn, och ger full kontroll över var datan behandlas. Det är samma sorts avvägning som mellan att hyra och att äga.
Att förstå inferens är att förstå var pengarna går i en AI-lösning – och därmed var det går att spara. Vill du resonera kring vad drift av en modell skulle kosta i ert fall, kan du läsa mer om våra AI-tjänster eller höra av dig med en beskrivning av förväntad användning.
Vanliga frågor
Vad är skillnaden mellan träning och inferens?
Träning är när modellen byggs och lär sig mönster ur data – ett tungt engångsarbete. Inferens är när den färdiga modellen används för att svara på en fråga, om och om igen i drift. Träningen görs en gång av dem som bygger modellen; inferensen sker varje gång någon ställer en fråga till den. De flesta företag berör bara inferensen.
Varför betalar företag nästan bara för inferens?
För att de flesta använder en färdig modell i stället för att träna en egen. Träningen av grundmodeller är extremt kostsam och görs av ett fåtal aktörer. Ni betalar i stället för att köra den färdiga modellen – för varje fråga den besvarar. Därför är det inferenskostnaden, inte träningskostnaden, som syns i budgeten för en typisk AI-lösning.
Vad påverkar inferenskostnaden?
Främst tre saker. Modellstorleken: en större modell kostar mer per körning. Mängden tokens: ju mer text som skickas in och genereras, desto högre kostnad. Och kraven på svarstid: snabbare svar kan kräva mer resurser. Att välja rätt modellstorlek för uppgiften, i stället för den största som finns, är ofta det som påverkar kostnaden mest.
Var körs inferens?
Antingen via ett API i molnet, där ni anropar en leverantörs modell och betalar per användning, eller på egen hårdvara som ni driftar själva. Molnet är enklast att komma igång med och skalar med användningen. Egen hårdvara kan löna sig vid stora, jämna volymer eller när data av känslighetsskäl inte får lämna era system. Valet beror på volym, kostnad och krav.
Går inferenskostnaden att sänka?
Ofta ja. Vanliga grepp är att välja en mindre modell där det räcker, korta ner det som skickas in, och undvika att skicka med mer historik än nödvändigt vid varje fråga. Även att spara och återanvända svar på återkommande frågor kan minska antalet körningar. Eftersom kostnaden räknas per token får sådana optimeringar direkt effekt på notan.