Spring til indhold
AI Ordbog

AI Ordbog

Tokenizer

Algoritmen der opdeler tekst i tokens som AI-modellen kan forstå.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er en tokenizer?

En tokenizer er algoritmen der oversætter mellem menneskeligt sprog og det tal-baserede format AI-modeller forstår. Den tager din tekst (sætninger, ord, tegn) og opdeler den i tokens: de grundlæggende enheder modellen arbejder med. Og den gør det modsatte når modellen svarer: konverterer tokens tilbage til læsbar tekst.

Tokenizeren sidder mellem dig og AI-modellen. Hver gang du skriver til ChatGPT eller Claude, er tokenizeren det første der behandler dit input og det sidste der former outputtet.

Tokenizeren er ikke en del af selve sprogmodellen. Den er et separat stykke software der kører før og efter modellen. Men valget af tokenizer har dyb indflydelse på modellens kapabilitet, pris og kvalitet.

Hvordan fungerer en tokenizer?

De fleste moderne tokenizers bruger en teknik kaldet BPE (Byte Pair Encoding):

  1. Start med tegn. Tokenizeren starter med at betragte hvert tegn (bogstav, tal, tegn) som en separat token.
  2. Find mønstre. Den finder de hyppigste par af tilstødende tokens i træningsteksten og slår dem sammen til én ny token.
  3. Gentag. Processen gentages tusindvis af gange. Hyppige ordkombinationer som “the”, “ing”, “tion” bliver til enkelte tokens.
  4. Ordforråd. Resultatet er et ordforråd (vocabulary) på typisk 32.000-200.000 tokens der dækker alt fra enkelt-tegn til hele ord og ordstumper.

Det betyder at hyppige ord (som “the” på engelsk) er én token, mens sjældne ord opdeles i flere tokens. Det danske ord “kommunalbestyrelsesmedlem” ville blive splittet i flere tokens, mens “i” sandsynligvis er én.

Tokenizer-forskelle mellem modeller

  1. GPT-4o og nyere (tiktoken). Bruger o200k_base-tokenizeren med ca. 200.000 tokens i ordforrådet. En markant udvidelse fra GPT-4’s cl100k_base (100.000 tokens), med bedre dækning af ikke-engelske sprog.
  2. Claude (Anthropic). Bruger sin egen tokenizer optimeret til bred sprogdækning, inklusive bedre håndtering af ikke-engelske sprog.
  3. Llama 3 (Meta). Bruger tiktoken-baseret BPE med et ordforråd på 128.000 tokens. En firedobling fra Llama 2’s 32.000 tokens (SentencePiece), hvilket giver bedre komprimering af ikke-engelske sprog.
  4. Gemini (Google). SentencePiece-baseret med et stort ordforråd designet til multilingval brug.

Hvorfor er tokenizeren vigtig?

  1. Pris. Du betaler per token i API-brug. En tokenizer der laver mange tokens af din danske tekst koster mere end en der tokeniserer effektivt.
  2. Context window-udnyttelse. Flere tokens per sætning = mindre plads i dit context window til faktisk indhold.
  3. Sprogkvalitet. Sprog der tokeniseres i mange små dele (som mange ikke-engelske sprog) kan modellen have sværere ved at behandle korrekt.
  4. Kodning. Tokenizere der behandler kode godt (hele variabelnavne, operatorer som tokens) giver bedre kode-output.

Tokenizer i praksis

  1. Token-tællere. Værktøjer som OpenAI’s tiktoken, Anthropic’s token counter og platform.openai.com/tokenizer lader dig se præcis hvordan din tekst tokeniseres.
  2. Prompt-optimering. Forståelse af tokenisering hjælper med at skrive mere effektive prompts. Kortere, mere direkte instruktioner sparer tokens og penge.
  3. Dansk vs. engelsk. Dansk tekst bruger typisk 30-50% flere tokens end tilsvarende engelsk tekst. Det skyldes at tokenizerens ordforråd primært er trænet på engelsk.
  4. Emoji og specialtegn. Emojis og specialtegn kan bruge overraskende mange tokens. En enkelt emoji kan koste 2-4 tokens.

Tokenizeren som flaskehals Tokenizeren er en ofte overset flaskehals for ikke-engelske sprog. Fordi de fleste tokenizers er trænet primært på engelske tekster, er engelske ord effektivt komprimerede mens danske, kinesiske eller arabiske tekster splittes i mange flere tokens. Det betyder højere pris, kortere effektiv kontekst og potentielt lavere kvalitet for ikke-engelske brugere. Multilingvale tokenizers bliver bedre, men der er stadig en markant forskel.


FAQ

Hvad er en tokenizer?

En tokenizer er algoritmen der konverterer tekst til tokens: de grundlæggende enheder en AI-model arbejder med. Den opdeler sætninger i ord, ordstumper eller tegn der mappes til tal, som modellen kan behandle.

Hvorfor bruger dansk flere tokens end engelsk?

Fordi de fleste tokenizers er trænet primært på engelske tekster. Engelske ord er velkendte og effektivt komprimerede, mens danske ord ofte splittes i flere tokens. "Sundhedsministeriet" kan nemt blive 4-5 tokens, mens det engelske "the" er én.

Kan jeg se hvordan min tekst tokeniseres?

Ja. OpenAI har en online tokenizer på platform.openai.com/tokenizer. Python-biblioteket tiktoken lader dig tokenisere programmatisk. Anthropic og andre udbydere har lignende værktøjer.


Relaterede termer