Spring til indhold
AI Ordbog

AI Ordbog

Throughput

Mængden af AI-forespørgsler eller tokens et system kan processere per tidsenhed.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er throughput?

Throughput er hvor meget arbejde et AI-system kan udføre per tidsenhed. Hvor latency handler om hastigheden for én enkelt forespørgsel (brugerens perspektiv), handler throughput om systemets samlede kapacitet (operatørens perspektiv).

Tænk på det som forskellen mellem en motorvej og en bil: latency er hvor hurtigt én bil kører fra A til B. Throughput er hvor mange biler motorvejen kan transportere per time. Du kan have en motorvej med høj hastighed (lav latency) men få baner (lav throughput), eller mange baner (høj throughput) men trængsel (høj latency).

I AI måles throughput typisk som:

  • Tokens per sekund for sprogmodeller
  • Forespørgsler per sekund (QPS) for API-tjenester
  • Billeder per minut for billedgeneratorer

Hvorfor er throughput vigtigt?

  1. Økonomi. Throughput bestemmer omkostningen per forespørgsel. Dobbelt throughput = halveret pris per forespørgsel (ved samme hardware). For virksomheder der kører millioner af forespørgsler er dette millionbesparelser.
  2. Skalerbarhed. Kan dit system håndtere alle dine brugere? Hvis du har 10.000 samtidige brugere og dit system kun kan processere 100 forespørgsler per sekund, har du et problem.
  3. Hardware-udnyttelse. GPU’er er dyre. Høj throughput betyder at du udnytter hardwaren bedre. Hver GPU genererer mere værdi per time.
  4. Service Level Agreements. Virksomheder lover typisk bestemte responstider. Tilstrækkelig throughput sikrer at disse kan overholdes selv under spidsbelastning.

Throughput vs. latency

Throughput og latency er ofte i konflikt:

  1. Batching øger throughput men øger latency. Ved at samle flere forespørgsler og processere dem samtidig udnytter du GPU’en bedre (høj throughput), men individuelle forespørgsler venter på at batchen fyldes (højere latency).
  2. Større modeller giver bedre kvalitet men lavere throughput. En 70B-model genererer færre tokens per sekund end en 7B-model.
  3. Optimering handler om balance. Det ideelle system har lav nok latency til at brugerne er tilfredse og høj nok throughput til at økonomien hænger sammen.
ScenariePrioritet
Chatbot med live-brugereLav latency
Batch-analyse af 1 million emailsHøj throughput
Kodningsassistent i IDELav latency
Generering af produktbeskrivelserHøj throughput

Hvad påvirker throughput?

  1. Hardware. Flere og hurtigere GPU’er = højere throughput. En H100 har markant højere throughput end en A100.
  2. Modelstørrelse. Mindre modeller har højere throughput. En 7B-model kan generere 5-10x flere tokens per sekund end en 70B-model.
  3. Batch size. Større batches øger throughput ved at udnytte GPU’ens parallelisme bedre. Men der er en grænse: for store batches overstiger GPU-hukommelsen.
  4. Quantization. Kvantiserede modeller bruger mindre hukommelse per parameter, hvilket tillader større batches og højere throughput.
  5. Inference-framework. Optimerede frameworks som vLLM, SGLang og TensorRT-LLM maksimerer throughput via teknikker som continuous batching og paged attention.
  6. Kontekstlængde. Længere kontekst kræver mere hukommelse og beregning, hvilket reducerer throughput.

Throughput-optimering

  1. Continuous batching. I stedet for at vente på at alle forespørgsler i en batch er færdige, indsættes nye forespørgsler løbende efterhånden som andre afsluttes. Markant bedre GPU-udnyttelse.
  2. Paged attention (vLLM). Intelligent hukommelseshåndtering der eliminerer spild. Tillader flere samtidige forespørgsler inden for samme GPU-hukommelse.
  3. Speculative decoding. En lille model foreslår flere tokens på én gang, den store model verificerer dem parallelt. Øger effektiv throughput.
  4. Model parallelism. Fordel modellen over flere GPU’er. Kræves for store modeller men øger også throughput.
  5. Quantization. 4-bit eller 8-bit quantization kan fordoble throughput med minimal kvalitetstab.
  6. Prefix caching. Genbrug beregninger for identiske prompt-prefixes (f.eks. system prompts). Sparer beregning for gentagne dele.

Throughput i praksis

  1. OpenAI / Anthropic API. Disse tjenester optimerer throughput for at betjene hundredvis af millioner brugere. Rate limits (forespørgsler per minut) er en direkte konsekvens af throughput-kapacitet.
  2. Self-hosted inference. Virksomheder der hoster egne modeller bruger frameworks som vLLM til at maksimere throughput og minimere GPU-omkostninger.
  3. Batch-processering. Store virksomheder processerer millioner af datapunkter (klassifikation, sentiment, extraction) og optimerer for throughput over latency.
  4. Edge AI. På enheder med begrænsede ressourcer er throughput begrænset, men optimeringsteknikker (quantization, pruning) hjælper.

Throughput-tal i praksis

Typiske throughput-værdier (per GPU):

  1. Llama 7B (kvantiseret, RTX 4090). 80-120 tokens/sekund per bruger, eller hundredvis med batching.
  2. Llama 70B (H100). 30-50 tokens/sekund per bruger, markant mere med optimal batching.
  3. Cloud API (Claude Sonnet). Rate limits fra 50 til 4.000 forespørgsler per minut afhængigt af tier.
  4. vLLM med continuous batching. Kan øge throughput 2-5x sammenlignet med naiv inference.

Throughput er AI-infrastrukturens bundlinje Når AI-virksomheder taler om at “reducere omkostninger per token,” taler de om at øge throughput. Mere throughput per GPU = lavere pris per forespørgsel = billigere AI for alle. Det er den tekniske optimering der gør AI-tjenester økonomisk bæredygtige ved skala. Derfor er inference-frameworks som vLLM og hardware-innovationer som NVIDIAs Blackwell-chips så vigtige.


FAQ

Hvad er throughput i AI?

Throughput er mængden af arbejde et AI-system kan udføre per tidsenhed, typisk målt som tokens per sekund eller forespørgsler per minut. Det er et mål for systemets samlede kapacitet og afgørende for skalerbarhed og økonomi.

Hvad er forskellen på throughput og latency?

Latency er ventetiden for én enkelt forespørgsel (brugerens perspektiv). Throughput er den samlede mængde forespørgsler systemet kan håndtere (operatørens perspektiv). Høj throughput og lav latency er begge ønskværdige men kan være i konflikt.

Hvordan øger man throughput?

De vigtigste teknikker er batching (processér flere forespørgsler samtidig), quantization (reducer modellens præcision), optimerede frameworks (vLLM, SGLang) og hurtigere hardware (nyere GPU'er).


Relaterede termer