Spring til indhold
AI Ordbog

AI Ordbog

Thinking tokens

De tokens en AI-model genererer som en del af sin interne tænkeproces, adskilt fra det endelige svar til brugeren.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er thinking tokens?

Thinking tokens er de tokens en AI-model genererer som en del af sin interne tænkeproces. Adskilt fra det svar brugeren ser. De er modellens “indre monolog”: den trinvise ræsonnering, de mellemberegninger, de overvejelser og den selvkontrol der finder sted før det endelige svar formuleres.

Tænk på det som forskellen mellem hvad en ekspert siger til dig, og hvad eksperten tænker inden de siger det. Når en læge fortæller dig din diagnose, har hun først gennemgået symptomer, udelukket alternativer, overvejet testresultater og nået en konklusion. Thinking tokens er den proces: den mentale gennemgang der sker bag kulisserne.

Thinking tokens blev et centralt koncept i AI da reasoning-modeller som OpenAI’s o1 og Claude med extended thinking demonstrerede at modeller producerer markant bedre svar på komplekse opgaver når de får mulighed for at “tænke” først. Konceptet har været centralt i AI-udviklingen siden 2024.

Hvordan fungerer thinking tokens?

Genereringsprocessen

Når en AI-model med thinking-kapabilitet modtager en prompt, gennemgår den to faser:

Fase 1: Generering af thinking tokens. Modellen genererer en sekvens af tokens der udgør dens tænkeproces. Disse tokens er ikke tilfældige. De følger en struktureret ræsonneringsproces:

[Brugerens spørgsmål]
↓
[Thinking tokens: Problemanalyse]
[Thinking tokens: Strategivalg]
[Thinking tokens: Trinvis løsning]
[Thinking tokens: Selvkontrol og verifikation]
[Thinking tokens: Konklusion]
↓
[Output tokens: Det endelige svar til brugeren]

Fase 2: Generering af output tokens. Baseret på tænkeprocessen genererer modellen sit endelige svar. Dette svar er typisk mere præcist, bedre struktureret og mere pålideligt end hvad modellen ville have produceret uden tænkeprocessen.

Hvad indeholder thinking tokens?

Thinking tokens kan indeholde mange typer ræsonnering:

Problemanalyse:

“Brugeren spørger om X. Det er et optimeringsproblem med følgende begrænsninger…”

Strategiovervejelse:

“Jeg kan løse dette på to måder: A eller B. Tilgang A er mere direkte men risikerer at overse kanttilfælde. Tilgang B er mere systematisk…”

Mellemberegninger:

“Først beregner jeg nettoomsætningen: 5.000 kunder × 500 kr./md = 2.500.000 kr./md. Med 4% churn mister vi 100 kunder/md…”

Selvkontrol:

“Lad mig kontrollere dette resultat. Hvis marginen er 80% og vi fastholder 100 ekstra kunder… Ja, det stemmer.”

Korrektion:

“Vent. Jeg antog at alle kunder betaler det samme, men spørgsmålet nævner to prisplaner. Lad mig genberegne med differentieret ARPU…”

Synlighed for brugeren

Thinking tokens håndteres forskelligt af forskellige platforme:

Synlige thinking tokens (Claude): I Claude’s API returneres thinking tokens som separate content blocks. Brugeren kan vælge at se dem, hvilket giver fuld transparens i modellens ræsonnering. I claude.ai vises de i en sammenklappelig sektion.

Delvist synlige (OpenAI o-serie): OpenAI viser en opsummering af ræsonneringsprocessen men ikke de fulde thinking tokens. API’en returnerer antallet af reasoning tokens men ikke altid det fulde indhold.

Skjulte thinking tokens: Nogle implementeringer skjuler thinking tokens helt og viser kun det endelige svar. Tænkeprocessen finder stadig sted, men brugeren ser den ikke.

Thinking tokens vs. output tokens

Thinking tokensOutput tokens
FormålIntern ræsonnering og problemløsningSvar til brugeren
SynlighedKan være synlige eller skjulteAltid synlige
IndholdAnalyser, beregninger, overvejelser, korrektionerDet endelige, polerede svar
StrukturUformel, eksplorativ, med fejl og rettelserStruktureret, klart, endeligt
PrisFaktureres til output-token-prisenStandard output-pris
KvalitetseffektForbedrer kvaliteten af output markantDen kvalitet brugeren oplever

Token-økonomi: Hvad koster thinking tokens?

Prisstruktur

Thinking tokens forbruger beregningsressourcer og faktureres. Prisstrukturen varierer mellem udbydere:

Anthropic Claude: Thinking tokens faktureres til output-token-prisen for den pågældende model. Budget kan styres via budget_tokens parameteren.

OpenAI o-serie: Reasoning tokens faktureres til output-token-prisen. Antallet af reasoning tokens varierer afhængigt af opgavens kompleksitet og modellens “reasoning effort” indstilling.

Eksempler på token-forbrug

Simpel opgave: “Opsummér denne artikel”

  • Input: 1.000 tokens
  • Thinking: 0 tokens (ikke nødvendigt)
  • Output: 200 tokens
  • Total: 1.200 tokens

Medium opgave: “Analysér denne kontrakt for risici”

  • Input: 3.000 tokens
  • Thinking: 2.000 tokens
  • Output: 800 tokens
  • Total: 5.800 tokens

Kompleks opgave: “Find fejlen i denne algoritme og forklar fix”

  • Input: 2.000 tokens
  • Thinking: 8.000 tokens
  • Output: 1.500 tokens
  • Total: 11.500 tokens

Meget kompleks opgave: “Design en systemarkitektur for denne applikation”

  • Input: 5.000 tokens
  • Thinking: 30.000+ tokens
  • Output: 3.000 tokens
  • Total: 38.000+ tokens

Er det pengene værd?

Nøglespørgsmålet: Giver de ekstra thinking tokens nok kvalitetsforbedring til at retfærdiggøre merprisen?

Ja, når:

  • Fejl er dyre (kode i produktion, finansielle beregninger, juridisk rådgivning)
  • Opgaven kræver flertrinsræsonnering
  • Du ellers ville bruge flere forsøg for at få et korrekt svar
  • Transparens i ræsonneringen er værdifuld

Nej, når:

  • Opgaven er simpel og modellen svarer korrekt uden tænketid
  • Volumen er højt og marginen per kald er lav
  • Latens er kritisk (thinking tokens tilføjer svartid)
  • Outputkvaliteten er “god nok” uden ræsonnering

Praktiske eksempler

Eksempel 1: Debugging med thinking tokens

Prompt: “Denne Python-funktion skulle returnere det næststørste tal i en liste, men den fejler for visse input. Find fejlen.”

def second_largest(nums):
    if len(nums) < 2:
        return None
    first = second = float('-inf')
    for n in nums:
        if n > first:
            second = first
            first = n
        elif n > second:
            second = n
    return second

Thinking tokens (forkortet):

Lad mig analysere denne funktion… Den tracker de to største tal. Lad mig trace den med [5, 5, 5]… first = 5, second = -inf. Andet 5: 5 > 5 er falsk. 5 > -inf er sandt, så second = 5. Returnerer 5. Men er 5 det næststørste? Alle tal er ens, så der er intet næststørste. Funktionen bør returnere None…

Hvad med [1, 2, 2]? first = 2, second = 2. Returnerer 2. Men det næststørste unikke tal er 1…

Problemet er at funktionen ikke håndterer duplikater. elif n > second fanger tilfælde hvor n er mindre end first men større end second, men den fanger ikke tilfældet hvor n er lig med first.

Output: En klar forklaring af fejlen og et fix der tilføjer elif n > second and n != first.

Uden thinking tokens ville modellen muligvis foreslå det mest almindelige bug-mønster i stedet for at identificere det specifikke problem med duplikater.

Eksempel 2: Forretningsanalyse

Prompt: “Vi har en SaaS med MRR 1,5M kr., 35% YoY growth, 6% månedlig churn og en burn rate på 800K kr./md. Investorer tilbyder 20M kr. til 100M pre-money. Skal vi tage pengene?”

Thinking tokens (forkortet):

Lad mig analysere dette systematisk…

Runway uden investering: Vi har brug for at vide cash position… Ikke angivet, men med 800K burn og 1,5M MRR: hvad er nettoomkostningen? MRR dækker en del, men churn og costs…

Lad mig beregne net burn: MRR 1,5M - costs 800K = +700K/md positiv. Vent. Burn rate er 800K, dvs. de brænder 800K UDOVER revenue? Eller er burn rate total costs? Det er typisk total cash burn inkl. revenue…

Hvis burn rate 800K er netto (costs minus revenue), er det bekymrende. Hvis det er brutto og MRR er 1,5M, er de cash flow positive…

Lad mig antage netto burn = 800K, dvs. total costs er 2,3M/md…

Churn 6% er høj for SaaS. 35% YoY growth er decent men ikke exceptionelt. Implicit: de skaffer nok nye kunder til at vokse 35% trods 6% churn, dvs. brutto-tilgang er ~41% annualiseret…

Valuering: 100M pre-money ved 18M ARR = 5,5x ARR. Det er fair for en virksomhed med den profil…

Dilution: 20M / (100M + 20M) = 16,7%…

Output: En struktureret analyse med beregninger, antagelser ekspliciteret, og en nuanceret anbefaling der adresserer usikkerhederne.

Eksempel 3: Matematisk bevis

Prompt: “Bevis at summen af de første n ulige tal er n².”

Thinking tokens (forkortet):

Jeg skal bevise at 1 + 3 + 5 + … + (2n-1) = n².

Lad mig bruge induktion.

Basis: n=1. Sum = 1. n² = 1. ✓

Induktionsantagelse: Antag det gælder for n=k, altså 1 + 3 + … + (2k-1) = k².

Induktionsskridt: Vis det for n=k+1. 1 + 3 + … + (2k-1) + (2(k+1)-1) = k² + (2k+1) = k² + 2k + 1 = (k+1)². ✓

Lad mig verificere med et eksempel: n=4. 1+3+5+7 = 16 = 4². ✓

Output: Et klart, velstruktureret induktionsbevis med forklaring af hvert trin.

Styring af thinking tokens

Budget-kontrol

I API’er kan man typisk styre mængden af thinking tokens:

Fast budget: Sæt et maksimum for thinking tokens. Modellen stopper tænkeprocessen når budgettet er opbrugt. Nyttigt til at kontrollere pris og latens.

Adaptivt: Modellen bruger den tænketid der er nødvendig. Simple opgaver får få thinking tokens, komplekse får mange. Giver den bedste kvalitet men er mindre forudsigelig i pris.

Reasoning effort: Nogle API’er tilbyder et abstraktionsniveau over rå token-budgetter: “low”, “medium”, “high” reasoning effort der oversættes til passende token-budgetter internt.

Bedste praksis

Start lavt, skru op ved behov: Begynd med et moderat thinking-budget og øg kun hvis kvaliteten ikke er tilstrækkelig.

Match budget til opgave: En simpel klassifikationsopgave behøver ikke 10.000 thinking tokens. En kompleks arkitekturbeslutning kan have brug for 50.000.

Monitorér thinking/output-ratio: Hvis thinking tokens konsekvent er 20x output tokens, er budgettet sandsynligvis for højt for opgavetypen.

Brug thinking tokens til kvalitetssikring: Læs thinking tokens for kritiske opgaver. De afslører om modellen forstod opgaven korrekt og ræsonnerede fornuftigt.

Thinking tokens og context window

Thinking tokens forbruger plads i modellens context window. Det har praktiske konsekvenser:

Eksempel: En model med et context window på 200.000 tokens.

  • Input-prompt: 50.000 tokens (et langt dokument)
  • Thinking budget: 30.000 tokens
  • Output: 5.000 tokens
  • Samlet: 85.000 tokens (stadig inden for vinduet)

Men med et meget stort input og et stort thinking-budget kan man nærme sig grænsen:

  • Input: 150.000 tokens
  • Thinking budget: 40.000 tokens
  • Output: 10.000 tokens → Overstiger 200.000

I praksis begrænser API’erne automatisk thinking tokens så de ikke overstiger det tilgængelige context window.

Begrænsninger

Ikke altid bedre

Thinking tokens forbedrer ikke alle opgaver. For simple opgaver er resultatet det samme. Bare dyrere og langsommere. Modeller kan endda “overtænke” og introducere unødvendig kompleksitet i simple svar.

Kvaliteten af tænkningen varierer

Thinking tokens er ikke en garanti for korrekte svar. Modellen kan ræsonnere overbevisende men tage udgangspunkt i forkerte antagelser. En lang tænkeproces kan give falsk tryghed: “den har jo tænkt grundigt over det.”

Latens

Hver thinking token tager tid at generere. 10.000 thinking tokens kan tilføje 10-30 sekunders ventetid afhængigt af model og infrastruktur. For interaktive applikationer er dette en mærkbar forsinkelse.

Pris ved skala

For applikationer der kører tusindvis af API-kald dagligt, kan thinking tokens udgøre en betydelig meromkostning. En applikation der bruger gennemsnitligt 5.000 thinking tokens per kald ved 10.000 daglige kald genererer 50 millioner ekstra tokens per dag.

Ofte stillede spørgsmål

Hvad er thinking tokens?

Thinking tokens er de tokens en AI-model genererer som en del af sin interne tænkeproces, adskilt fra det endelige svar brugeren ser. De repræsenterer modellens trinvise ræsonnering (problemanalyse, mellemberegninger, overvejelser og selvkontrol) og genereres før output-tokens. Thinking tokens er en central komponent i reasoning-modeller og extended thinking, og de er grunden til at modeller som Claude med extended thinking og OpenAI’s o-serie leverer markant bedre svar på komplekse opgaver.

Koster thinking tokens penge?

Ja, thinking tokens faktureres fordi de kræver beregningsressourcer at generere. Prisstrukturen varierer mellem udbydere, men thinking tokens faktureres typisk til output-token-prisen for den pågældende model. Mængden af thinking tokens varierer fra få hundrede for simple opgaver til titusindvis for meget komplekse problemer. Du kan kontrollere omkostningen ved at sætte et budget for thinking tokens via API-parametrene.

Kan man se thinking tokens?

Det afhænger af platformen. I Claude’s API returneres thinking tokens som separate content blocks der kan vises til brugeren. I claude.ai vises de i en sammenklappelig sektion. OpenAI’s o-serie viser en opsummering af ræsonneringen men ikke altid de fulde thinking tokens. Synlighed af thinking tokens er værdifuldt for transparens, fejlfinding og tillid til modellens svar.

Hvornår bør man bruge thinking tokens?

Thinking tokens giver mest værdi på opgaver der kræver logisk ræsonnering, flertrinsberegninger eller nuanceret analyse: programmering, matematik, juridisk vurdering, finansiel modellering, arkitekturbeslutninger. De er ikke nødvendige for simple opgaver som opsummering, oversættelse eller faktuelle spørgsmål. En god tommelfingerregel: hvis opgaven har et objektivt korrekt svar der kræver flere trin at nå, er thinking tokens sandsynligvis pengene værd.


Relaterede termer