Hva er en token?

Av Weapp · Oppdatert

En token er den ordbiten en språkmodell regner i, omtrent fire tegn eller tre fjerdedeler av et ord på engelsk, og noe flere tokens per ord på norsk. Tokens styrer både pris og begrensninger: API-kostnaden settes per million tokens inn og ut, og taket i kontekstvinduet måles i tokens. Å forstå dem gjør AI-kostnaden forutsigbar.

En token er den minste tekstbiten en språkmodell regner i, en ordbit. Begrepet høres teknisk ut, men det er verdt å forstå for alle som skal kjøpe eller budsjettere for AI, for tokens styrer både hva tjenesten koster og hvor grensene går. Her er hva de er og hvorfor de dukker opp i hver prisliste og spesifikasjon.

Ordbitene modellen regner i

En språkmodell leser ikke tekst bokstav for bokstav, og heller ikke strengt ord for ord. Den deler opp teksten i tokens, biter som ofte er et helt ord, men like gjerne kan være en orddel, et skilletegn eller et mellomrom. Ordet «faktura» kan bli én enkelt token, mens et lengre eller mer uvanlig ord deles opp i flere.

En nyttig tommelfingerregel er at en token tilsvarer omtrent fire tegn, eller rundt tre fjerdedeler av et ord på engelsk. På norsk blir det som regel noe flere tokens per ord fordi norske ord og lange sammensetninger håndteres mindre effektivt av modellenes oppdeling. Tommelfingerregelen er et anslag, ikke en eksakt formel, men den er god nok til planlegging og budsjettering.

Hvorfor tokens styrer prisen

Her blir tokens et direkte forretningsspørsmål. Arbeidet en modell utfører, står i forhold til hvor mye tekst den leser og skriver, og tokens er nettopp målet på det. Derfor prises nesten alle API-tjenester per million tokens.

Prisen er oftest delt i to: en kostnad for tokens inn, det du sender til modellen, og en annen for tokens ut, det modellen svarer. Prisen for tokens ut er som regel høyere enn prisen for tokens inn. Konsekvensen er lett å forstå: Lange prompter og lange svar koster mer enn korte. En løsning som sender med store mengder bakgrunnsinformasjon ved hvert kall, bruker flere tokens, og dermed mer penger, enn en som holder seg kortfattet.

Et konkret regneeksempel gjør det tydelig. Si at et typisk spørsmål pluss svar i løsningen dere ser for dere, havner på noen hundre tokens til sammen, og at dere regner med tusenvis av kall i måneden. Da blir totalen tokens per kall ganger antallet kall, priset per million tokens inn og ut. Poenget er ikke det eksakte tallet, men at kostnaden kan regnes ut på forhånd når man forstår at den drives av tokens.

Koblingen til kontekstvinduet

Tokens setter ikke bare prisen, men også en grense. Hver modell har et kontekstvindu, den største mengden tekst den kan holde i hodet samtidig, og det taket måles i tokens.

Alt regnes med i vinduet: Det du sender inn og det modellen svarer, må til sammen få plass innenfor grensen. Prøver man å mate inn et dokument som er større enn kontekstvinduet, går det ikke. Teksten må da kortes ned eller deles opp i mindre deler. Det er nettopp derfor man i RAG-løsninger deler opp dokumenter i mindre biter og bare sender inn de mest relevante avsnittene ved hvert spørsmål, for å holde seg innenfor vinduet og samtidig gi modellen riktig grunnlag.

Å forstå tokens gir deg også grep for å holde kostnaden nede. Fordi både inndata og utdata telles, lønner det seg å sende bare det grunnlaget som trengs ved hvert kall, i stedet for alt man har, og å be om konsise svar der det holder. I en RAG-løsning er det en av gevinstene ved å hente nettopp de mest relevante avsnittene: Færre unødvendige tokens inn betyr lavere kostnad uten at svaret blir dårligere. Mange leverandører tilbyr dessuten rabatt på gjentatt innhold gjennom caching, og det kan senke regningen ytterligere for prompter som ligner hverandre.

For en beslutningstaker holder det å ta med seg tre ting: En token er en ordbit, prisen settes per million tokens inn og ut, og taket i kontekstvinduet måles i samme enhet. Med den forståelsen blir både kostnaden og begrensningene i en AI-løsning noe man kan planlegge for, i stedet for noe som overrasker. Vil du ha hjelp til å anslå tokenkostnaden for en løsning dere vurderer, kan du lese mer om arbeidet vårt med AI eller ta kontakt.

Ofte stilte spørsmål

Hva er en token, enkelt forklart?

En token er en bit av en tekst, oftest et helt ord eller en del av et ord. Det er i slike biter språkmodellen teller og behandler tekst. Modeller leser og skriver ikke bokstav for bokstav eller ord for ord, men nettopp i disse bitene. Antallet tokens i en tekst avgjør både hva det koster å behandle den og hvor mye som får plass.

Hvor mange tegn er en token?

En god tommelfingerregel er at en token tilsvarer omtrent fire tegn, eller rundt tre fjerdedeler av et ord på engelsk. På norsk blir det ofte noe flere tokens per ord fordi norske ord og sammensetninger håndteres mindre effektivt av modellenes oppdeling. Det er et anslag, ikke en eksakt formel, men det er godt nok til planlegging.

Hvorfor settes AI-priser per token?

Fordi arbeidet en modell utfører, er proporsjonalt med hvor mye tekst den leser og skriver, og tokens måler nettopp det. Derfor prises API-tjenester per million tokens, oftest med én pris for tokens inn (det du sender) og en annen for tokens ut (det modellen svarer). Lengre prompter og lengre svar koster altså mer.

Hva har tokens med kontekstvinduet å gjøre?

Kontekstvinduet er den største mengden tekst en modell kan holde i hodet samtidig, og det taket måles i tokens. Alt du sender inn, pluss det modellen svarer, må få plass innenfor vinduet. Er grunnlaget for stort, må det kortes ned eller deles opp, og det er en av grunnene til at man deler opp dokumenter i RAG-løsninger.

Hvordan regner man ut tokens for å anslå kostnaden?

Ta utgangspunkt i tommelfingerregelen om fire tegn per token, og regn på det volumet dere forventer: omtrent hvor mange tokens et typisk spørsmål og et typisk svar blir, ganger antallet kall. Multipliser med gjeldende pris per million tokens inn og ut. Prisene endrer seg, så bruk leverandørens gjeldende prisliste og test med ekte eksempler.