Hvad er tokens i AI?
Et token er det ordstykke en sprogmodel regner i, cirka fire tegn eller tre fjerdedele af et ord på engelsk og lidt flere på dansk. Tokens styrer både pris og begrænsninger: API-prisen sættes pr. million tokens ind og ud, og kontekstvinduets loft måles i tokens. Forstår man dem, bliver AI-udgiften forudsigelig.
Et token er det mindste stykke tekst som en sprogmodel regner i, et ordstykke. Begrebet lyder teknisk, men det er værd at forstå for alle der skal købe eller budgettere AI fordi tokens styrer både hvad tjenesten koster og hvor dens grænser går. Her er hvad de er og hvorfor de dukker op i hver eneste prisliste og specifikation.
Ordstykkerne modellen regner i
En sprogmodel læser ikke tekst bogstav for bogstav og heller ikke strengt ord for ord. Den deler teksten op i tokens, stykker der ofte er et helt ord, men lige så godt kan være en orddel, et tegnsætningstegn eller et mellemrum. Ordet “faktura” kan blive et enkelt token mens et længere eller mere usædvanligt ord deles op i flere.
En brugbar tommelfingerregel er at et token svarer til cirka fire tegn eller omkring tre fjerdedele af et ord på engelsk. På dansk bliver det som regel lidt flere tokens pr. ord fordi danske ord og lange sammensætninger håndteres mindre effektivt af modellernes opdeling. Tommelfingerreglen er et skøn, ikke en eksakt formel, men den rækker fint til at planlægge og budgettere.
Derfor styrer tokens prisen
Her bliver tokens et direkte forretningsspørgsmål. Det arbejde en model udfører, står i forhold til hvor meget tekst den læser og skriver, og tokens er netop målet for det. Derfor prissættes næsten alle API-tjenester pr. million tokens.
Prisen er oftest delt i to: en pris for tokens ind, det du sender til modellen, og en anden for tokens ud, det modellen svarer. Prisen for output er som regel højere end prisen for input. Konsekvensen er let at forstå: Lange prompter og lange svar koster mere end korte. En løsning der sender store mængder baggrundsmateriale med ved hvert kald, bruger flere tokens, og dermed flere penge, end en der fatter sig i korthed.
Et konkret regneeksempel gør det tydeligt. Lad os sige at et typisk spørgsmål plus svar i jeres tænkte løsning lander på nogle hundrede tokens tilsammen og at I regner med tusindvis af kald om måneden. Så bliver det samlede forbrug tokens pr. kald gange antallet af kald, prissat pr. million tokens ind og ud. Pointen er ikke det eksakte tal, men at udgiften kan regnes ud på forhånd når man forstår at den drives af tokens.
Koblingen til kontekstvinduet
Tokens sætter ikke kun prisen, men også en grænse. Hver model har et kontekstvindue (context window), den største mængde tekst den kan have i hovedet på én gang, og det loft måles i tokens.
Alt tælles med i vinduet: Det du sender ind og det modellen svarer, skal tilsammen kunne være under grænsen. Forsøger man at fodre modellen med et dokument der er større end kontekstvinduet, går det ikke, og teksten må forkortes eller deles op i mindre dele. Det er netop derfor man i RAG-løsninger deler dokumenter op i mindre stykker og kun sender de mest relevante afsnit ind ved hvert spørgsmål: for at holde sig inden for vinduet og samtidig give modellen det rette materiale.
At forstå tokens giver også redskaber til at holde udgiften nede. Da både input og output tæller med, betaler det sig kun at sende det materiale der er brug for ved hvert kald, i stedet for alt hvad man har, og at bede om kortfattede svar hvor det er nok. I en RAG-løsning er det en af gevinsterne ved at hente netop de mest relevante afsnit: Færre unødvendige tokens ind betyder lavere udgift uden at svaret bliver dårligere. Mange leverandører giver desuden rabat på tilbagevendende indhold gennem caching, og det kan sænke regningen yderligere for prompter der ligner hinanden.
For en beslutningstager er det nok at tage tre ting med sig: Et token er et ordstykke, prisen sættes pr. million tokens ind og ud, og kontekstvinduets loft måles i samme enhed. Med den forståelse bliver både udgiften og begrænsningerne i en AI-løsning til at planlægge efter i stedet for at komme som en overraskelse. Vil du have hjælp til at anslå token-udgiften for en tænkt løsning, kan du læse mere om vores arbejde med AI eller kontakte os.
Ofte stillede spørgsmål
Hvad er et token, enkelt forklaret?
Et token er et stykke af en tekst, oftest et helt ord eller en del af et ord, som sprogmodellen regner og arbejder i. Modeller læser og skriver ikke bogstav for bogstav eller ord for ord, men i netop de stykker. Antallet af tokens i en tekst afgør både hvad den koster at behandle og hvor meget der er plads til.
Hvor mange tegn er et token?
En god tommelfingerregel er at et token svarer til cirka fire tegn eller omkring tre fjerdedele af et ord på engelsk. På dansk bliver det ofte lidt flere tokens pr. ord fordi danske ord og sammensætninger håndteres mindre effektivt af modellernes opdeling. Det er et skøn, ikke en eksakt formel, men det rækker til at planlægge.
Hvorfor prissættes AI pr. token?
Fordi det arbejde en model udfører, er proportionalt med hvor meget tekst den læser og skriver, og tokens måler netop det. Derfor prissættes API-tjenester pr. million tokens, oftest med én pris for tokens ind (det du sender) og en anden for tokens ud (det modellen svarer). Længere prompter og længere svar koster altså mere.
Hvad har tokens med kontekstvinduet at gøre?
Kontekstvinduet er den maksimale mængde tekst en model kan have i hovedet på én gang, og det loft måles i tokens. Alt hvad du sender ind, plus det modellen svarer, skal kunne være inden for vinduet. Er materialet for stort, må det forkortes eller deles op, og det er en af grundene til at man deler dokumenter op i RAG-løsninger.
Hvordan tæller man tokens for at anslå udgiften?
Gå ud fra tommelfingerreglen om fire tegn pr. token, og regn på jeres egen forventede volumen: cirka hvor mange tokens et typisk spørgsmål og et typisk svar fylder, gange antallet af kald. Gang med den aktuelle pris pr. million tokens ind og ud hver for sig. Priserne ændrer sig, så brug leverandørens gældende prisliste, og test på rigtige eksempler.