AI Ordbog
Inference
Processen hvor en trænet AI-model genererer output baseret på nyt input.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er inference?
Inference er det øjeblik hvor en AI-model bruges. Det er processen hvor en færdigtrænet model modtager nyt input (en prompt, et billede, en lydoptagelse) og genererer et output baseret på det den har lært under træning.
Når du skriver en besked til ChatGPT og den svarer, er det inference. Når Midjourney genererer et billede fra din prompt, er det inference. Når Whisper transskriberer din tale, er det inference. Al brug af AI-modeller er inference.
Inference er modsætningen til træning: under træning lærer modellen fra data. Under inference anvender modellen det den har lært.
Træning vs. inference
| Træning | Inference | |
|---|---|---|
| Hvad sker der | Modellen lærer fra data | Modellen genererer output |
| Hvornår | Én gang (eller sjældent) | Hver gang modellen bruges |
| Compute | Enormt (uger/måneder på tusindvis af GPU’er) | Mindre per forespørgsel men akkumulerer |
| Data | Træningsdata (terabytes) | Brugerens input (kilobytes) |
| Omkostning | Millioner af dollars én gang | Løbende, per forespørgsel |
| Optimering | Modelkvalitet | Hastighed og omkostning |
Hvorfor er inference vigtigt?
- Det er den løbende omkostning. Træning er en engangsinvestering. Inference er den omkostning der kører 24/7 hver gang nogen bruger modellen. For store tjenester som ChatGPT med hundredvis af millioner brugere er inference-omkostningen astronomisk.
- Brugeroplevelsen. Inference-hastighed afgør om din AI-applikation føles hurtig eller langsom. Ingen vil vente 30 sekunder på et svar.
- Skalerbarhed. En model kan trænes én gang, men inference skal skalere til millioner af samtidige brugere.
- Edge deployment. Inference på enheder (smartphones, biler, IoT) kræver modeller der kan køre med begrænsede ressourcer.
Inference-processen for en LLM
Når du sender en prompt til en sprogmodel:
- Tokenisering. Din tekst konverteres til tokens. Tal som modellen forstår.
- Prefill. Modellen processerer alle input-tokens parallelt og opbygger en intern repræsentation (KV-cache).
- Autoregresiv generering. Modellen genererer output ét token ad gangen. Hvert nyt token afhænger af alle tidligere tokens.
- Detokenisering. Output-tokens konverteres tilbage til læsbar tekst.
- Streaming. Tokens sendes til brugeren efterhånden som de genereres. Det er derfor du ser teksten dukke op ord for ord.
Trin 3 er flaskehalsen: modellen kan kun generere ét token ad gangen sekventielt. Det er grunden til at lange svar tager tid.
Inference-optimering
Fordi inference er den løbende omkostning, investeres der enormt i at gøre den hurtigere og billigere:
- Quantization. Reducer præcisionen af modellens tal (f.eks. fra 16-bit til 4-bit). Hurtigere og billigere med minimal kvalitetstab.
- Batching. Processér flere forespørgsler simultant i stedet for én ad gangen. Udnytter GPU’ens parallelisme bedre.
- KV-cache. Gem mellemresultater så modellen ikke behøver genberegne hele konteksten for hvert nyt token.
- Speculative decoding. En lille hurtig model foreslår tokens, den store model verificerer dem. Hurtigere end at den store model gør alt selv.
- Model distillation. Træn en mindre, hurtigere model til at efterligne den stores adfærd.
- Hardware-optimering. Specialiserede chips (NVIDIA TensorRT, Google TPU) og optimerede biblioteker (vLLM, TGI).
- Context caching. Gem og genbrug processeringen af system prompts og anden statisk kontekst.
Inference i praksis
- Cloud API. Når du bruger ChatGPT, Claude eller Gemini, kører inference på udbyderens GPU-klynger. Du betaler per token.
- Self-hosted. Virksomheder kører inference på egen infrastruktur med open source-modeller via frameworks som vLLM, TGI eller Ollama.
- Edge inference. AI der kører direkte på enheden: Siri på iPhone, autocomplete på din tastatur, ansigtsgenkendelse i kameraet.
- Batch inference. Processering af store datamængder offline: klassificering af millioner af emails, analyse af kundefeedback, generering af produktbeskrivelser.
Inference-omkostninger
Inference er en enorm industri:
- Token-prissætning. API-udbydere fakturerer per token. Input-tokens er billigere end output-tokens fordi output genereres sekventielt.
- GPU-tid. Self-hosted inference faktureres typisk per GPU-time. En H100 koster $2-4 per time i cloud.
- Skala. OpenAI bruger anslået hundredtusindvis af GPU’er alene til inference. Det er en milliardforretning.
- Optimering betaler sig. En 2x forbedring i inference-effektivitet halverer omkostningerne. Ved Googles og OpenAIs skala er det milliarder af dollars.
Inference-tid compute
En nyere trend er at bruge mere compute under inference for at forbedre kvaliteten:
- Extended thinking. Modeller som Claude og o1 bruger ekstra “tænketid” under inference til at ræsonnere grundigere.
- Chain-of-thought. Modellen genererer mellemliggende ræsonneringstrin der forbedrer det endelige svar.
- Best-of-N. Generér flere svar og vælg det bedste. Dyrere men højere kvalitet.
Denne tilgang bytter inference-compute for bedre kvalitet. Det modsatte af den traditionelle tilgang der fokuserer på at minimere inference-omkostninger.
Inference er der hvor AI møder virkeligheden Træning er forskning. Det sker i laboratoriet. Inference er produktion. Det sker når rigtige mennesker bruger AI. En model kan være nok så imponerende på benchmarks, men hvis inference er for langsom, for dyr eller for upålidelig, skaber den ingen værdi. Inference-optimering er derfor en af de vigtigste discipliner i AI-industrien, og en af grundene til at hardware-virksomheder som NVIDIA er blevet så værdifulde.
FAQ
Hvad er inference i AI?
Inference er processen hvor en færdigtrænet AI-model genererer output fra nyt input. Hver gang du bruger ChatGPT, genererer et billede med DALL-E eller transskriberer tale med Whisper, er det inference der sker.
Hvad er forskellen på træning og inference?
Træning er når modellen lærer fra data. Det sker én gang og er ekstremt dyrt. Inference er når modellen bruges. Det sker hver gang nogen sender en forespørgsel. Træning kræver mere compute per session, men inference akkumulerer over millioner af forespørgsler.
Hvorfor er inference dyrt?
Inference kræver GPU-compute for hver eneste forespørgsel, og store tjenester håndterer millioner af forespørgsler dagligt. Sprogmodeller genererer output ét token ad gangen, hvilket er sekventielt og beregningstungt. Ved stor skala er inference-omkostningen typisk højere end træningsomkostningen.