AI Ordbog
Latency
Tiden det tager fra en AI-forespørgsel sendes til det første svar modtages.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er latency?
Latency (forsinkelse) er den tid der går fra du sender en forespørgsel til en AI-model til du modtager det første svar. Det er ventetiden. Når du trykker Enter i ChatGPT og der går et par sekunder før teksten begynder at dukke op. Det er latency.
I AI-sammenhæng skelner man typisk mellem to typer latency:
- Time to First Token (TTFT). Tiden fra forespørgsel til det første token i svaret genereres. Det er den ventetid brugeren oplever før “noget sker.”
- Total latency. Tiden fra forespørgsel til hele svaret er færdigt. For lange svar kan dette være mange sekunder.
Latency er afgørende for brugeroplevelsen. Studier viser at brugere begynder at miste tålmodighed efter 2-3 sekunder. I interaktive AI-applikationer er lav latency forskellen mellem en app der føles hurtig og en der føles langsom.
Hvad påvirker latency?
- Modelstørrelse. Større modeller har flere parametre der skal beregnes for hvert token. GPT-4 er langsommere end GPT-4o mini fordi den er markant større.
- Input-længde. Længere prompts kræver mere processering i prefill-fasen (den fase hvor modellen læser dit input). En prompt med 100.000 tokens tager længere at processere end en med 100.
- Output-længde. Hvert output-token genereres sekventielt. Længere svar = mere tid. Et svar på 1.000 tokens tager ca. 10x længere end et på 100.
- Hardware. Hurtigere GPU’er og mere GPU-hukommelse reducerer latency. En H100 er markant hurtigere end en A100.
- Netværk. Afstanden mellem din computer og API-serveren tilføjer netværkslatency. Typisk 10-100ms afhængigt af geografi.
- Belastning. Når mange brugere bruger tjenesten samtidig, kan køer opstå. Det er derfor ChatGPT kan føles langsommere i spidsbelastningsperioder.
- Quantization. Kvantiserede modeller (lavere præcision) kører hurtigere og har lavere latency end full-precision modeller.
Latency i tal
Typiske latency-værdier for AI-modeller:
- Hurtige modeller (Claude Haiku, GPT-4o mini). TTFT: 200-500ms. Generering: 50-100 tokens/sekund.
- Standard modeller (Claude Sonnet, GPT-4o). TTFT: 500ms-2s. Generering: 30-70 tokens/sekund.
- Store modeller (Claude Opus, GPT-4). TTFT: 1-5s. Generering: 15-40 tokens/sekund.
- Billedgenerering (DALL-E, Midjourney). 5-30 sekunder per billede.
- Lokal inference (Ollama + Llama). Varierer enormt med hardware. GPU: 20-80 tokens/sekund. CPU: 2-10 tokens/sekund.
Hvorfor er latency vigtigt?
- Brugeroplevelse. I chatbots og assistenter er lav latency afgørende. Brugere forventer svar inden for 1-2 sekunder. Høj latency føles som om systemet er langsomt eller gået ned.
- Realtidsapplikationer. Stemmeassistenter, live-oversættelse og interaktiv kodning kræver latency under 500ms for at føles naturligt.
- Agentic AI. AI-agenter der udfører mange sekventielle handlinger akkumulerer latency. Hvis hvert trin tager 3 sekunder og der er 20 trin, er det et minuts ventetid.
- Produktivitet. I kodningsværktøjer som Copilot og Claude Code er lav latency afgørende: forslag skal dukke op mens du stadig tænker over linjen, ikke efter du er gået videre.
Optimering af latency
- Streaming. Send tokens til brugeren efterhånden som de genereres i stedet for at vente på hele svaret. Reducerer ikke total latency men den oplevede ventetid drastisk.
- Smaller models. Brug den mindste model der er god nok til opgaven. Haiku til simple spørgsmål, Opus kun til komplekse opgaver.
- Quantization. Kvantisér modellen til lavere præcision. 4-bit modeller er markant hurtigere end 16-bit med minimal kvalitetstab for de fleste opgaver.
- Prompt-optimering. Kortere prompts = lavere latency. Fjern unødvendig kontekst og hold system prompts koncise.
- Caching. Cache svar for gentagne forespørgsler. Prompt caching genbruger prefill-beregninger for identiske prompt-prefixes.
- Edge deployment. Kør modellen tættere på brugeren, eller direkte på enheden, for at eliminere netværkslatency.
- Bedre hardware. Hurtigere GPU’er, mere VRAM og hurtigere interconnects reducerer alle latency.
Latency vs. throughput
Latency og throughput er relaterede men forskellige:
- Latency. Hvor lang tid tager én forespørgsel? (Brugerens perspektiv)
- Throughput. Hvor mange forespørgsler kan håndteres per sekund? (Systemets perspektiv)
Du kan have høj throughput med høj latency (mange brugere processeres men alle venter) eller lav latency med lav throughput (én bruger betjenes hurtigt men kun én ad gangen). God infrastruktur optimerer begge.
Latency er den usynlige kvalitetsfaktor Vi taler meget om modelkvalitet: hvor gode svarene er. Men latency er lige så vigtig for den samlede brugeroplevelse. En model der giver gode svar men tager 10 sekunder per svar føles langsom og frustrerende. En hurtigere model med lidt lavere kvalitet kan ofte give en bedre samlet oplevelse. De bedste AI-produkter finder den rette balance mellem kvalitet og hastighed.
FAQ
Hvad er latency i AI?
Latency er den tid der går fra du sender en forespørgsel til en AI-model til du modtager det første svar. Lav latency (hurtig respons) er afgørende for en god brugeroplevelse, særligt i chatbots, stemmeassistenter og kodningsværktøjer.
Hvad er god latency for en AI-model?
For chatbots og assistenter er TTFT (Time to First Token) under 1 sekund ønskværdigt. For realtidsapplikationer som stemmeassistenter kræves under 500ms. For billedgenerering er 5-15 sekunder acceptabelt.
Hvorfor er nogle AI-modeller hurtigere end andre?
Modelstørrelse er den primære faktor: mindre modeller har færre beregninger per token og er derfor hurtigere. Hardware, optimeringsteknikker (quantization, batching) og netværksafstand spiller også ind.