Spring til indhold
AI Ordbog

AI Ordbog

Context caching

En teknik der gemmer og genbruger den processerede kontekst fra tidligere forespørgsler, så identisk input ikke skal beregnes igen.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er context caching?

Context caching er en teknik der gemmer resultatet af at processere input-kontekst i en AI-model, så det kan genbruges i efterfølgende forespørgsler. I stedet for at modellen beregner den samme kontekst forfra hver gang, henter den de gemte mellemberegninger og starter derfra.

Forestil dig at du skal lave 50 beregninger der alle starter med de samme 20 trin. Uden caching laver du alle 20 forberedende trin hver gang. Altså 1.000 trin i alt. Med caching laver du de 20 trin én gang, gemmer resultatet, og starter de resterende 50 beregninger derfra. Altså 20 + 50 = 70 trin. Det er en dramatisk besparelse.

I AI-modeller er “de 20 forberedende trin” processering af den faste kontekst (systemprompt, dokumenter, instruktioner) og “de 50 beregninger” er de individuelle brugerforespørgsler. Context caching eliminerer det gentagne arbejde.

Hvorfor er context caching vigtigt?

Omkostningsreduktion

API-priser for AI-modeller beregnes per token. Hvis du sender en systemprompt på 10.000 tokens med hver forespørgsel, og du har 1.000 forespørgsler om dagen, betaler du for 10 millioner tokens systemprompt alene. Med context caching betaler du kun for den første processering af de 10.000 tokens. Efterfølgende forespørgsler genbruger cachen til en markant lavere pris.

Typiske besparelser:

UdbyderCachede tokens pris vs. normal
Anthropic (Claude)90% billigere (10% af normal pris)
Google (Gemini)Op til 90% billigere for Gemini 2.5+
OpenAI50-90% billigere (afhængigt af model)

For systemer med store, gentagne kontekster kan context caching reducere den samlede API-regning med 50-90%.

Lavere latens

Processering af kontekst tager tid. Jo længere kontekst, jo længere tid. Time to first token (TTFT) for en forespørgsel med 200.000 tokens kontekst kan være flere sekunder. Med context caching springer modellen over den allerede processerede del og begynder at generere svar næsten øjeblikkeligt.

Det er særligt mærkbart for long context-anvendelser. Hvis du har uploadet en hel bog (200.000 tokens) og stiller spørgsmål til den, vil hvert spørgsmål uden caching kræve at modellen processerer hele bogen igen. Med caching processeres bogen én gang, og hvert efterfølgende spørgsmål starter fra den gemte tilstand.

Bedre brugeroplevelse

Hurtigere svar og lavere priser muliggør AI-oplevelser der ellers ville være for dyre eller for langsomme. En kundeservice-chatbot der har adgang til hele virksomhedens produktkatalog (50.000 tokens) kan svare lige så hurtigt som en chatbot med minimal kontekst. Fordi katalog-konteksten er cachet.

Hvordan fungerer context caching teknisk?

KV-cachen

Transformer-baserede sprogmodeller bruger en attention-mekanisme der for hvert token beregner Key (K) og Value (V) vektorer. Disse KV-par udgør modellens “hukommelse” af den processerede kontekst. Under generering bruger modellen KV-cachen til at se tilbage på alle tidligere tokens.

Uden context caching:

Forespørgsel 1: [Systemprompt + Dokument + Spørgsmål 1]
→ Beregn KV-cache for hele inputtet fra bunden
→ Generer svar

Forespørgsel 2: [Systemprompt + Dokument + Spørgsmål 2]
→ Beregn KV-cache for hele inputtet fra bunden (igen!)
→ Generer svar

Med context caching:

Forespørgsel 1: [Systemprompt + Dokument + Spørgsmål 1]
→ Beregn KV-cache for [Systemprompt + Dokument] → GEM i cache
→ Beregn KV-cache for [Spørgsmål 1] (inkrementelt)
→ Generer svar

Forespørgsel 2: [Systemprompt + Dokument + Spørgsmål 2]
→ HENT KV-cache for [Systemprompt + Dokument] fra cache
→ Beregn KV-cache kun for [Spørgsmål 2] (inkrementelt)
→ Generer svar

Den afgørende detalje: KV-cachen kan kun genbruges for et præfiks: tokens der kommer i starten af inputtet og er identiske. Hvis du ændrer ét token i systemprompt eller dokument, invalideres cachen for alt efter det ændrede token.

Præfiks-matching

Context caching virker via præfiks-matching: den cachede kontekst skal matche begyndelsen af den nye forespørgsel præcist. Det er som et bogmærke. Du kan kun fortsætte fra præcis det punkt der er gemt.

Cachet præfiks: "Du er en hjælpsom assistent. Her er dokumentet: [...]"

Match:    "Du er en hjælpsom assistent. Her er dokumentet: [...] Hvad handler det om?"  ✓
Ingen match: "Du er en venlig assistent. Her er dokumentet: [...] Hvad handler det om?"  ✗

Selv en minimal ændring i begyndelsen bryder cachen. Derfor er det vigtigt at strukturere forespørgsler med den stabile del først (systemprompt, dokumenter) og den varierende del sidst (brugerens spørgsmål).

Cache-levetid og eviction

Cachede kontekster har en begrænset levetid:

  • Anthropic: Cachen lever i 5 minutter (standard) eller 1 time og forlænges automatisk ved brug. Ubrugte caches udløber.
  • Google: Konfigurerbar TTL (time to live) op til 1 time. Kan fornyes eksplicit.
  • OpenAI: Automatisk caching med intern styring af levetid.

Cachen gemmes typisk i GPU-hukommelse for hurtig adgang. Da GPU-hukommelse er begrænset, bruger udbydere eviction-strategier (typisk LRU / least recently used) til at fjerne sjældent brugte caches og gøre plads til nye.

Praktiske anvendelser

Chatbot med fast kontekst

En virksomheds AI-chatbot har typisk en systemprompt med virksomhedens retningslinjer, tone of voice, produktinformation og FAQ. Denne kontekst kan være 5.000-50.000 tokens og er identisk for alle brugerinteraktioner.

Uden caching: Hver brugerbesked sender hele systemprompt + samtalehistorik. 100 samtidige brugere = 100 gange processering af den samme systemprompt.

Med caching: Systemprompten processeres én gang og caches. Alle 100 brugere deler den cachede KV-cache for systemprompt-delen. Kun brugerens individuelle besked og samtalehistorik beregnes.

Dokumentanalyse med mange spørgsmål

En analytiker uploader en årsrapport på 80 sider (100.000 tokens) og stiller 20 spørgsmål til den:

Uden caching: 20 × 100.000 = 2.000.000 tokens processeret. Pris: ~$6 (ved $3/M tokens).

Med caching: 100.000 tokens processeret første gang + 19 × 100.000 cachede tokens. Cachede tokens koster 10% af normal pris. Pris: ~$0.87. Besparelse: 85%.

AI-kodningsassistent

En kodningsassistent der har adgang til en stor kodebase cacher kodebasens kontekst. Når udvikleren stiller forskellige spørgsmål eller beder om ændringer, genbruges den cachede forståelse af kodebasen. Hvert nyt spørgsmål kræver kun processering af selve spørgsmålet. Ikke hele kodebasen igen.

Batch-processering

Når man skal køre den samme analyse på mange dokumenter med identisk systemprompt og instruktioner, kan den faste del caches. For eksempel: klassificering af 10.000 e-mails med den samme klassificerings-prompt. Systemprompten processeres én gang, og de 10.000 e-mails processeres individuelt med den cachede kontekst.

Multi-turn samtaler

I en samtale med flere ture vokser konteksten for hver tur fordi hele samtalehistorikken sendes med. Context caching sikrer at de tidligere dele af samtalen (der er identiske fra tur til tur) ikke genberegnes. Kun det nyeste bruger-input og model-svar processeres fra bunden.

Context caching hos de store udbydere

Anthropic (Claude)

Anthropic tilbyder “prompt caching” for Claude-modellerne:

  • Cache-markering sker via API’en med en cache_control-parameter
  • Cachede tokens koster 10% af normal input-pris
  • Der er en engangspris for at skrive til cachen (25% over normal pris for 5-minutters cache, 100% for 1-times cache)
  • Cache-levetid: 5 minutter eller 1 time, forlænges automatisk ved brug
  • Minimumsstørrelse: 1.024 tokens for caching

Google (Gemini)

Google tilbyder “context caching” for Gemini-modellerne:

  • Implicit caching er aktiveret som standard siden maj 2025. Besparelser gives automatisk ved cache-hits
  • Eksplicit caching opretter en navngivet ressource via API’en med konfigurerbar TTL
  • Cachede tokens koster 10% af normal input-pris for Gemini 2.5+ (25% for ældre modeller)
  • Understøtter caching af tekst, billeder, video og lyd (multimodal)
  • Minimumsstørrelse: 2.048 tokens for caching

OpenAI

OpenAI tilbyder automatisk prompt caching:

  • Caching sker automatisk for gentagne præfikser. Ingen eksplicit opsætning
  • Cachede tokens koster 50% af normal input-pris
  • Minimum 1.024 tokens præfiks for at udløse caching
  • Transparent for brugeren. Caching sker bag kulisserne

Hvornår giver context caching mening?

God kandidat for caching

  • Lang, stabil kontekst: Systemprompts, dokumenter eller instruktioner der ikke ændrer sig mellem forespørgsler
  • Mange forespørgsler: Jo flere gange konteksten genbruges, jo større besparelse
  • Interaktive samtaler: Multi-turn dialoger hvor samtalehistorikken vokser
  • Batch-jobs: Mange forespørgsler med identisk opsætning

Dårlig kandidat for caching

  • Unik kontekst: Hvis hver forespørgsel har helt unik kontekst, er der intet at cache
  • Kort kontekst: Hvis konteksten kun er et par hundrede tokens, er besparelsen minimal
  • Sjældne forespørgsler: Hvis der går lang tid mellem forespørgsler, udløber cachen
  • Varierende præfiks: Hvis konteksten ændres hyppigt, invalideres cachen konstant

Designprincipper

Placér det stabile først: Strukturér forespørgsler så den faste del (systemprompt, dokumenter) kommer først og den variable del (brugerens spørgsmål) kommer sidst. Det maksimerer cache-hitrate.

Undgå unødvendig variation: Timestamps, request-ID’er eller andre variable elementer i systemprompt invaliderer cachen. Hold den faste del fuldstændig statisk.

Batch intelligently: Gruppér forespørgsler der deler kontekst, og send dem tæt tidsmæssigt for at holde cachen varm.

Context caching vs. KV-cache

Der er to relaterede men forskellige koncepter:

KV-cache (intern): Under generering af et svar gemmer modellen KV-par for alle processerede tokens i den aktuelle forespørgsel. Det er en standard del af transformer-inference og sker automatisk. KV-cachen lever kun inden for en enkelt forespørgsel.

Context caching (ekstern): KV-cachen fra en forespørgsel gemmes og genbruges i en ny, separat forespørgsel. Det er en eksplicit optimering der kræver at udbydere gemmer KV-cachen mellem forespørgsler.

Context caching er altså genbrug af KV-cachen på tværs af forespørgsler. En udvidelse af den interne KV-cache-mekanisme.

Begrænsninger

Præfiks-kravet

Kun eksakt matchende præfikser kan caches. Hvis du har to dokumenter A og B og vil stille spørgsmål til begge, kan du ikke cache dem i samme cache-entry medmindre de altid sendes i samme rækkefølge. Ændrer du rækkefølgen fra [A, B] til [B, A], invalideres cachen.

Hukommelsesbegrænsning

KV-cacher er store. Flere gigabytes for lange kontekster. Udbydere kan ikke holde ubegrænsede caches i GPU-hukommelse. Det betyder at sjældent brugte caches evictes, og at der er praktiske grænser for hvor mange samtidige caches der kan eksistere.

Ikke altid økonomisk

Caching har en engangspris for at skrive til cachen (typisk 25-100% over normal pris). Hvis konteksten kun bruges 1-2 gange, kan caching være dyrere end at processere fra bunden. Break-even ligger typisk ved 3-5 genbruger.

Ofte stillede spørgsmål

Hvad er context caching?

Context caching er en teknik i AI-systemer der gemmer den processerede repræsentation af input-kontekst (Key-Value cachen) så den kan genbruges i efterfølgende forespørgsler. I stedet for at modellen processerer den samme systemprompt, de samme dokumenter eller den samme samtalehistorik forfra hver gang, henter den de gemte mellemberegninger og starter derfra. Det reducerer både latens (hurtigere svar) og omkostninger (lavere API-pris). Typisk 50-90% billigere for cachede tokens.

Hvornår bør jeg bruge context caching?

Context caching giver mest mening når du har en lang, stabil kontekst der genbruges mange gange. Typiske scenarier: en chatbot med en stor systemprompt, en dokumentanalyse-pipeline der stiller mange spørgsmål til det samme dokument, eller batch-processering af mange inputs med identiske instruktioner. Det giver mindre mening for korte kontekster, unikke forespørgsler eller kontekster der ændres hyppigt.

Hvad er forskellen på context caching og KV-cache?

KV-cache er en intern mekanisme i transformer-modeller der gemmer mellemberegninger under generering af ét svar. Den lever kun inden for en enkelt forespørgsel. Context caching udvider dette ved at gemme KV-cachen mellem forespørgsler, så den kan genbruges af efterfølgende forespørgsler med samme kontekst-præfiks. KV-cache sker automatisk, context caching er en eksplicit optimering der kræver support fra modeludbyderen.

Hvor meget kan jeg spare med context caching?

Besparelsen afhænger af hvor stor en del af din kontekst der er stabil og genbruges. Cachede tokens er typisk 50-90% billigere end normale tokens (afhængigt af udbyder). Hvis 90% af din forespørgsel er stabil kontekst og du sender 100 forespørgsler, kan du spare 80-85% på den samlede API-regning. Break-even ligger typisk ved 3-5 genbruger af den samme cache. Derunder kan caching koste mere end normal processering.


Relaterede termer