Spring til indhold
AI Ordbog

AI Ordbog

Inference-time compute

Strategien med at bruge mere beregningskraft under brug af en AI-model (inference) i stedet for under træning, for at forbedre kvaliteten af svar.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er inference-time compute?

Inference-time compute er strategien med at investere ekstra beregningsressourcer når en AI-model genererer et svar (inference), i stedet for udelukkende under træning. I stedet for at gøre modellen større eller træne den på mere data, lader man modellen “tænke længere” over hvert enkelt svar.

Traditionelt har AI-fremskridt handlet om skalering under træning: større modeller, mere data, mere compute under træning. Inference-time compute vender den logik om: hvad hvis vi i stedet bruger mere compute når modellen skal løse en opgave?

Tænk på forskellen mellem en studerende der har studeret i fire år og svarer lynhurtigt på eksamen, versus en studerende der har studeret i to år men får tre timer ekstra til at tænke over hvert spørgsmål. Inference-time compute er de ekstra tre timer. Og det viser sig at de kan være lige så værdifulde som de ekstra to års studier.

Tilgangen blev for alvor mainstream med OpenAIs o1-model i september 2024 og har siden defineret en ny generation af “reasoning models” fra alle de store AI-virksomheder.

Hvordan fungerer inference-time compute?

Tænk-før-du-svarer

Den simpleste form for inference-time compute er at lade modellen producere en tankeproces før det endelige svar:

Uden inference-time compute:

Spørgsmål: Hvad er 17 × 23?
Svar: 391

Med inference-time compute (chain-of-thought):

Spørgsmål: Hvad er 17 × 23?
Tænkning: Lad mig dele det op.
17 × 23 = 17 × 20 + 17 × 3
17 × 20 = 340
17 × 3 = 51
340 + 51 = 391
Svar: 391

Modellen bruger flere tokens (mere compute) på at ræsonnere sig frem til svaret. For simple opgaver er forskellen lille, men for komplekse problemer kan det betyde forskellen mellem et forkert og et korrekt svar.

Extended thinking

Reasoning models som OpenAIs o1/o3 og Anthropics Claude med extended thinking bruger en endnu mere intensiv form for inference-time compute:

  1. Modellen genererer en intern tankeproces. Ofte hundredvis eller tusindvis af tokens
  2. Tankeprocessen er ikke nødvendigvis synlig for brugeren (men kan gøres synlig)
  3. Modellen kan iterere. Prøve en tilgang, erkende at den er forkert, og prøve en anden
  4. Modellen kan verificere sit eget svar og rette fejl

Denne proces bruger markant mere compute per svar. Men producerer markant bedre resultater på svære opgaver.

Skalering af tænketid

Forskning har vist at der er en systematisk sammenhæng mellem mængden af inference-time compute og kvaliteten af svaret. En “inference-time scaling law”:

Svarkvalitet som funktion af tænketid:

Kvalitet
    |
    |                    ___________
    |                   /
    |                  /
    |                /
    |              /
    |            /
    |          /
    |        /
    |      /
    |____/
    +----------------------------------------→ Inference-time compute

Mere tænketid giver konsekvent bedre svar. Indtil et plateau hvor yderligere compute giver diminishing returns. Placeringen af plateauet afhænger af opgavens sværhed.

Inference-time compute vs. trænings-time compute

Det traditionelle paradigme

Bedre AI = Større model + Mere data + Mere trænings-compute

Al investering sker under træning. Under inference bruger modellen minimal compute. Den genererer hvert token hurtigt baseret på sine trænede vægte.

Det nye paradigme

Bedre AI = God model + Mere inference-time compute per opgave

Investeringen flyttes delvist til inference. En mellemstor model der bruger 10x mere compute under inference kan matche eller slå en langt større model der svarer hurtigt.

Sammenligning

DimensionTrænings-time computeInference-time compute
HvornårUnder træning (engangs)Under brug (per svar)
Hvem betalerModeludviklerenBrugeren (per forespørgsel)
EffektBedre generel modelBedre svar på specifikke opgaver
SkalerbarhedBegrænset af data og hardwareKan skaleres per opgave
Cost-profilStor engangs investeringLøbende variabel cost
FleksibilitetFast efter træningKan tilpasses per opgave

Komplementære tilgange

I praksis er de to tilgange komplementære. Ikke konkurrerende. De bedste systemer kombinerer:

  • En stærk basismodel (høj trænings-time compute)
  • Med mulighed for ekstra tænketid (høj inference-time compute) på svære opgaver
  • Og hurtige svar (lav inference-time compute) på lette opgaver

Teknikker for inference-time compute

Chain-of-thought (CoT)

Modellen producerer en eksplicit tankeproces med mellemregninger. Den simpleste og mest udbredte form for inference-time compute.

Tree-of-thought

Modellen udforsker flere mulige tilgange parallelt, evaluerer dem, og vælger den bedste. Bruger mere compute men finder ofte bedre løsninger end lineær chain-of-thought.

Self-consistency

Modellen genererer flere uafhængige svar på det samme spørgsmål og vælger det svar der optræder oftest. Baseret på idéen om at det korrekte svar er det mest sandsynlige at nå uanset ræsonneringssti.

Iterativ forfining

Modellen producerer et første svar, kritiserer det, og forfiner det over flere iterationer. Hver iteration bruger ekstra compute men forbedrer svaret.

Verifier-modeller

En separat model evaluerer og scorer svar fra den primære model. De bedste svar vælges, og den primære model kan generere nye forsøg baseret på feedback.

Søgebaserede metoder

Modellen udforsker et søgetræ af mulige svar, ofte med Monte Carlo Tree Search (MCTS) eller lignende algoritmer. Særligt effektivt til matematik, kodning og logik.

Inference-time compute i praksis

Reasoning models

De mest prominente eksempler på inference-time compute er reasoning models:

ModelUdviklerTilgang
o3, o4-miniOpenAIIntern chain-of-thought, ikke synlig for brugeren
Claude (extended thinking)AnthropicKonfigurerbar tænketid, synlig tankeproces
Gemini 2.5 FlashGoogleHurtig reasoning med konfigurerbar tænketid
DeepSeek-R1DeepSeekOpen source reasoning model

Adaptiv compute

Moderne systemer tilpasser mængden af inference-time compute til opgavens sværhed:

  • Let spørgsmål (“Hvad er hovedstaden i Frankrig?”): Minimal tænketid, hurtigt svar
  • Middel spørgsmål (“Forklar forskellen mellem TCP og UDP”): Moderat tænketid
  • Svær opgave (“Løs denne differentialligning og bevis resultatet”): Intensiv tænketid, mange tokens ræsonnering

Det giver en effektiv allokering af compute. Man bruger kun ekstra ressourcer når det er nødvendigt.

Implikationer for pris og hastighed

Inference-time compute har direkte konsekvenser for brugere:

Pris: Reasoning models er dyrere per forespørgsel fordi de genererer flere tokens (tænke-tokens). En opgave der kræver 10.000 tænke-tokens plus 500 output-tokens koster markant mere end en der kun genererer 500 output-tokens.

Hastighed: Mere tænketid betyder længere ventetid. Et svar der kræver 30 sekunders tænkning føles anderledes end et øjeblikkeligt svar. Men det er ofte værd at vente.

Kvalitet: For komplekse opgaver (matematik, kodning, analyse) er kvalitetsforbedringen markant. For simple opgaver er fordelen minimal.

Betydningen af inference-time compute

Et nyt paradigme for AI-fremskridt

Inference-time compute repræsenterer et skift i tilgang. Historisk har AI-fremskridt primært handlet om at træne bedre modeller. Nu handler det også om at bruge modeller mere effektivt under inference. Det åbner en ny dimension for forbedring der ikke kræver større modeller eller mere træningsdata.

Demokratisering

Inference-time compute kan demokratisere adgang til stærk AI. En mindre, billigere model med mere tænketid kan matche en enorm, dyr model. Og den er tilgængelig for flere virksomheder og udviklere.

Specialisering per opgave

Med inference-time compute kan den samme model levere hurtige, billige svar på lette opgaver og langsomme, dyre men højkvalitets-svar på svære opgaver. Brugeren (eller systemet) kan vælge det rette trade-off for hver forespørgsel.

Udfordringer

Cost-management: Uforudsigelig tænketid gør det sværere at budgettere API-costs.

Latency: Brugere forventer hurtige svar. 30 sekunders ventetid er acceptabelt for en kompleks analyse men ikke for en simpel chatbesked.

Overforbrug: Modeller kan bruge unødvendig tænketid på lette opgaver hvis de ikke er kalibreret korrekt.

Ofte stillede spørgsmål

Hvad er inference-time compute?

Inference-time compute er strategien med at investere ekstra beregningsressourcer når en AI-model genererer et svar, i stedet for udelukkende under træning. Ved at lade modellen “tænke længere” (via chain-of-thought ræsonnering, extended thinking eller iterativ problemløsning) kan den producere markant bedre svar på komplekse opgaver. Reasoning models som OpenAIs o1/o3 og Anthropics Claude med extended thinking er de mest prominente eksempler.

Hvorfor er inference-time compute vigtig?

Fordi det repræsenterer et nyt paradigme for AI-fremskridt. Historisk er modeller blevet bedre primært ved at træne dem på mere data med mere compute. Inference-time compute viser at man også kan forbedre svar ved at bruge mere compute under brug. Det åbner en ny dimension for forbedring, gør det muligt at tilpasse compute per opgave, og kan demokratisere adgang til stærk AI ved at lade mindre modeller levere bedre resultater med mere tænketid.

Hvad er forskellen på inference-time compute og scaling laws?

Scaling laws beskriver hvordan mere trænings-compute (større model, mere data) giver forudsigeligt bedre modeller. Det er en engangsinvestering. Inference-time compute investerer compute under brug, per svar, og kan tilpasses til opgavens sværhed. De to er komplementære: de bedste systemer bruger både god træning og intelligent inference-time compute. Inference-time compute er særligt interessant fordi det er fleksibelt og kan skaleres uafhængigt af modellens træning.

Er reasoning models det samme som inference-time compute?

Reasoning models er den mest synlige implementering af inference-time compute, men de er ikke det eneste eksempel. Inference-time compute dækker alle teknikker der bruger ekstra compute under svar: chain-of-thought, self-consistency, tree-of-thought, iterativ forfining og verifier-modeller. Reasoning models kombinerer typisk flere af disse teknikker i et integreret system der automatisk allokerer tænketid baseret på opgavens kompleksitet.


Relaterede termer