Vad är en token?
En token är den ordbit en språkmodell räknar i – ungefär fyra tecken eller trekvarts ord på engelska, något fler på svenska. Tokens styr både pris och begränsningar: API-kostnaden sätts per miljon tokens in och ut, och kontextfönstrets tak mäts i tokens. Att förstå dem gör AI-kostnaden förutsägbar.
En token är den minsta biten text som en språkmodell räknar i – en ordbit. Begreppet låter tekniskt, men det är värt att förstå för vem som helst som ska köpa eller budgetera AI, för tokens styr både vad tjänsten kostar och var dess gränser går. Här är vad de är och varför de dyker upp i varje prislista och specifikation.
Ordbitarna modellen räknar i
En språkmodell läser inte text bokstav för bokstav, och inte heller strikt ord för ord. Den delar upp texten i tokens – bitar som ofta är ett helt ord, men lika gärna kan vara en orddel, ett skiljetecken eller ett mellanslag. Ordet “faktura” kan bli en enda token, medan ett längre eller ovanligare ord delas upp i flera.
En användbar tumregel är att en token motsvarar ungefär fyra tecken, eller runt trekvarts ord på engelska. På svenska blir det i regel något fler tokens per ord, eftersom svenska ord och långa sammansättningar hanteras mindre effektivt av modellernas uppdelning. Tumregeln är en uppskattning, inte en exakt formel, men den räcker gott för att planera och budgetera.
Varför tokens styr priset
Här blir tokens en direkt affärsfråga. Det arbete en modell utför står i proportion till hur mycket text den läser och skriver, och tokens är just måttet på det. Därför prissätts nästan alla API-tjänster per miljon tokens.
Priset är oftast uppdelat i två delar: en kostnad för tokens in – det du skickar till modellen – och en annan för tokens ut, det modellen svarar. Utpriset är i regel högre än inpriset. Konsekvensen är enkel att ta till sig: långa prompter och långa svar kostar mer än korta. En lösning som skickar med stora mängder bakgrund vid varje anrop drar mer tokens, och därmed mer pengar, än en som håller sig kortfattad.
Ett konkret räkneexempel gör det tydligt. Säg att en typisk fråga plus svar i er tänkta lösning landar på några hundra tokens tillsammans, och att ni räknar med tusentals anrop i månaden. Då blir totalen tokens per anrop gånger antalet anrop, prissatt per miljon tokens in och ut. Poängen är inte den exakta siffran, utan att kostnaden går att räkna ut i förväg när man förstår att den drivs av tokens.
Kopplingen till kontextfönstret
Tokens sätter inte bara priset utan också en gräns. Varje modell har ett kontextfönster – den största mängd text den kan hålla i huvudet samtidigt – och det taket mäts i tokens.
Allt räknas in i fönstret: det du skickar in och det modellen svarar måste tillsammans rymmas under gränsen. Försöker man mata in ett dokument som är större än kontextfönstret går det inte, utan texten måste kortas eller delas upp i mindre delar. Det är just därför man i RAG-lösningar styckar dokument i mindre bitar och bara skickar in de mest relevanta styckena vid varje fråga – för att hålla sig inom fönstret och samtidigt ge modellen rätt underlag.
Att förstå tokens ger också handtag för att hålla nere kostnaden. Eftersom både in- och utdata räknas lönar det sig att skicka bara det underlag som behövs vid varje anrop i stället för allt man har, och att be om koncisa svar där det räcker. I en RAG-lösning är det en av vinsterna med att hämta just de mest relevanta styckena: färre onödiga tokens in betyder lägre kostnad utan att svaret blir sämre. Många leverantörer erbjuder dessutom rabatt för återkommande innehåll genom cachning, vilket kan sänka notan ytterligare för prompter som liknar varandra.
För en beslutsfattare räcker det att bära med sig tre saker: en token är en ordbit, priset sätts per miljon tokens in och ut, och kontextfönstrets tak mäts i samma enhet. Med den förståelsen blir både kostnaden och begränsningarna i en AI-lösning möjliga att planera för i stället för att överraska. Vill du ha hjälp att uppskatta token-kostnaden för en tänkt lösning, läs mer om vårt arbete med AI eller hör av dig.
Vanliga frågor
Vad är en token, enkelt förklarat?
En token är en bit av en text – oftast ett helt ord eller en del av ett ord – som språkmodellen räknar och bearbetar i. Modeller läser och skriver inte bokstav för bokstav eller ord för ord, utan i just dessa bitar. Antalet tokens i en text avgör både vad den kostar att bearbeta och hur mycket som får plats.
Hur många tecken är en token?
En bra tumregel är att en token motsvarar ungefär fyra tecken, eller runt trekvarts ord på engelska. På svenska blir det ofta något fler tokens per ord, eftersom svenska ord och sammansättningar hanteras mindre effektivt av modellernas uppdelning. Det är en uppskattning, inte en exakt formel, men den räcker för att planera.
Varför sätts AI-priser per token?
För att arbetet en modell utför är proportionellt mot hur mycket text den läser och skriver, och tokens mäter just det. Därför prissätts API-tjänster per miljon tokens, oftast med ett pris för tokens in (det du skickar) och ett annat för tokens ut (det modellen svarar). Längre prompter och längre svar kostar alltså mer.
Vad har tokens med kontextfönstret att göra?
Kontextfönstret är den maximala mängd text en modell kan hålla i huvudet samtidigt, och det taket mäts i tokens. Allt du skickar in plus det modellen svarar måste rymmas inom fönstret. Är underlaget för stort måste det kortas eller delas upp, vilket är en av anledningarna till att man styckar dokument i RAG-lösningar.
Hur räknar man tokens för att uppskatta kostnaden?
Utgå från tumregeln fyra tecken per token och räkna på er egen förväntade volym: ungefär hur många tokens en typisk fråga och ett typiskt svar blir, gånger antalet anrop. Multiplicera med aktuellt pris per miljon tokens in respektive ut. Priser ändras, så använd leverantörens gällande prislista och testa på riktiga exempel.