Spring til indhold
AI Ordbog

AI Ordbog

Long context

AI-modeller med ekstra store context windows der kan behandle hundredtusinder eller millioner af tokens i en enkelt forespørgsel.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er long context?

Long context refererer til AI-modeller der kan behandle meget store mængder tekst (hundredtusinder eller millioner af tokens) i en enkelt forespørgsel. Hvor tidlige sprogmodeller var begrænset til et par tusinde tokens (svarende til et par sider tekst), kan moderne long context-modeller arbejde med hele bøger, store kodebaser eller omfattende dokumentsamlinger på én gang.

For at sætte det i perspektiv: GPT-3 (2020) havde et context window på 4.096 tokens. Ca. 3.000 ord eller 6 sider tekst. GPT-4.1 og Claude understøtter op til 1 million tokens. Gemini 2.5 Pro understøtter op til 1 million tokens med 2 millioner under udrulning.

Denne udvikling er ikke bare en kvantitativ forbedring. Den ændrer fundamentalt hvad AI-modeller kan bruges til. Opgaver der tidligere var umulige (som at analysere en hel lovsamling, gennemgå måneders e-mailkorrespondance eller forstå en komplet kodebase) bliver pludselig mulige i et enkelt kald.

Hvorfor er long context vigtigt?

Opgaver der kræver stor kontekst

Mange opgaver i den virkelige verden kræver at man forstår store mængder information i sammenhæng:

Dokumentanalyse: Juridiske kontrakter, årsrapporter, teknisk dokumentation og forskningsartikler er ofte hundredvis af sider lange. Med long context kan hele dokumentet sendes til modellen i stedet for at blive klippet i stykker.

Kodeforståelse: En reel kodebase består af hundredvis eller tusindvis af filer der refererer til hinanden. For at forstå en funktion skal man ofte kende resten af systemet. Long context gør det muligt at give modellen hele den relevante kodebase.

Samtalehistorik: I lange samtaler med en AI-assistent er det vigtigt at modellen husker hvad der blev sagt tidligere. Et stort context window betyder at samtalen kan være længere uden at modellen “glemmer” den tidlige del.

Oversættelse og lokalisering: Konsistens i terminologi og stil kræver at oversættelsesmodellen har adgang til hele dokumentet. Ikke bare den aktuelle paragraf.

Fra chunking til direkte processing

Før long context var den typiske tilgang at dele store dokumenter op i mindre bidder (chunks), processere dem individuelt, og derefter forsøge at samle resultaterne. Denne tilgang har fundamentale begrænsninger:

Information går tabt mellem chunks: Sammenhænge der krydser chunk-grænser fanges ikke. Hvis side 3 refererer til noget på side 47, og de er i forskellige chunks, går forbindelsen tabt.

Redundant arbejde: De samme dele af dokumentet skal ofte processeres flere gange i forskellige kontekster.

Kompleksitet: Chunking-strategier, overlap-beregninger og resultat-sammensætning tilføjer betydelig kompleksitet til systemet.

Long context eliminerer eller reducerer behovet for chunking ved at lade modellen se hele dokumentet på én gang.

Context window-størrelser

ModelContext windowCa. svarende til
GPT-3 (2020)4.096 tokens6 sider tekst
GPT-4 (2023)128.000 tokensEn kort bog
Claude (2024)200.000 tokensEn hel bog
Gemini 1.5 Pro (2024)2.000.000 tokensFlere bøger / stor kodebase
GPT-4.1 (2025)1.000.000 tokensFlere bøger / stor kodebase
Gemini 2.5 Pro (2025)1.000.000 tokensFlere bøger / stor kodebase

Tendensen er klar: context windows vokser eksponentielt. Hvad der var state-of-the-art i 2023 er standard i 2025, og modeller med 10+ millioner tokens context er under udvikling.

Hvordan fungerer long context teknisk?

Udfordringen: Attention-mekanismens kompleksitet

Transformer-baserede sprogmodeller bruger en attention-mekanisme der lader hvert token “se” alle andre tokens i konteksten. Beregningskompleksiteten for standard attention er O(n²). Den vokser kvadratisk med antallet af tokens. Det betyder:

  • 4.000 tokens: ~16 millioner attention-beregninger
  • 200.000 tokens: ~40 milliarder attention-beregninger
  • 2.000.000 tokens: ~4 billioner attention-beregninger

At gå fra 4.000 til 2 millioner tokens kræver 250.000 gange mere attention-beregning. Det er en enorm teknisk udfordring.

Løsninger

Sparse attention: I stedet for at hvert token ser alle andre tokens, ser det kun et udvalg. Det reducerer kompleksiteten fra O(n²) til O(n log n) eller O(n√n). Eksempler inkluderer Longformer og BigBird.

Sliding window attention: Hvert token ser kun sine nærmeste naboer (et vindue) plus et udvalg af globale tokens. Det bevarer lokal kontekst og giver en vis global forståelse.

Ring attention: Distribuerer attention-beregningen over flere GPU’er i en ring-topologi. Hver GPU beregner attention for sin del af sekvensen og sender resultater videre til den næste. Det muliggør ekstremt lange kontekster ved at parallelisere beregningen.

Multi-head latent attention: En teknik brugt af bl.a. DeepSeek der komprimerer key-value cachen for at reducere hukommelsesforbruget markant, hvilket muliggør længere kontekster med samme hardware.

Linear attention: Varianter der approximerer standard attention med lineær kompleksitet O(n), hvilket gør ekstremt lange kontekster beregningmæssigt mulige.

RoPE-skalering (Rotary Position Embedding): En teknik der udvider en models context window uden fuld genoptræning. Ved at justere de positionelle embeddings kan en model der er trænet med 4.000 tokens kontekst udvides til 100.000+ tokens med minimal yderligere træning.

Hukommelsesbehov

Ud over beregning kræver long context også betydelig hukommelse. Key-Value (KV) cachen (der gemmer mellemberegninger for alle tidligere tokens) vokser lineært med kontekstlængden:

  • 4.000 tokens KV-cache: ~100 MB
  • 200.000 tokens KV-cache: ~5 GB
  • 2.000.000 tokens KV-cache: ~50 GB

Teknikker som KV-cache kvantisering, paged attention og context caching hjælper med at reducere og genbruge denne hukommelse.

Long context vs. RAG

En central debat i AI-arkitektur er hvornår man skal bruge long context (send alt til modellen) versus RAG (Retrieval-Augmented Generation: find de relevante dele først og send kun dem).

Long contextRAG
TilgangSend alt til modellenSøg og send kun relevant kontekst
NøjagtighedModellen ser alt. Intet oversesRetrieval kan misse relevante stykker
LatensLangsom for meget store inputsHurtigere. Mindre kontekst at processere
PrisDyrere. Alle tokens kosterBilligere. Færre input-tokens
KompleksitetSimpel. Bare send det heleMere kompleks. Kræver retrieval-pipeline
Bedst tilHele dokumenter, kodebaser, dybe analyserStore videnbaser, mange dokumenter, specifikke opslag

Hvornår bruge long context

  • Hele dokumentet er relevant (kontrakt-review, boganalyse)
  • Sammenhænge på tværs af dokumentet er vigtige
  • Du har brug for at modellen forstår den fulde kontekst
  • Dokumentet passer inden for context window

Hvornår bruge RAG

  • Videnbasen er for stor til context window (millioner af dokumenter)
  • Kun en lille del er relevant for forespørgslen
  • Pris og hastighed er kritiske
  • Information opdateres hyppigt

Kombination

I praksis kombineres de to tilgange ofte: RAG bruges til at finde de mest relevante dokumenter fra en stor samling, og long context bruges til at processere de fundne dokumenter grundigt. Det giver det bedste fra begge verdener.

Praktiske anvendelser

Kodeassistenter

AI-kodningsværktøjer som Claude Code, Cursor og GitHub Copilot udnytter long context til at forstå hele kodebaser. I stedet for kun at se den aktive fil kan modellen se hundredvis af filer og forstå arkitekturen, konventionerne og afhængighederne. Det resulterer i mere præcis kodegenerering der passer ind i det eksisterende system.

Juridisk analyse

Advokater og jurister kan sende hele kontrakter, lovtekster eller retspraksis til en long context-model og stille spørgsmål som: “Hvilke forpligtelser har køber under denne aftale?” eller “Er der uoverensstemmelser mellem paragraf 3 og paragraf 17?” Modellen har hele dokumentet i konteksten og kan finde sammenhænge på tværs af hundredvis af sider.

Finansiel due diligence

Ved opkøb og investeringer skal analytikere gennemgå enorme mængder dokumentation: årsrapporter, bestyrelsesreferater, kontrakter, patenter. Long context gør det muligt at sende hele pakken til modellen og bede om en struktureret analyse med kildehenvisninger.

Kreativ skrivning og redigering

Forfattere og redaktører kan sende et helt manuskript til modellen og bede om feedback på plot-konsistens, karakterudvikling og tempo. Modellen kan fange at en karakter har blå øjne i kapitel 2 men brune øjne i kapitel 15. Det kræver forståelse af hele teksten.

Mødereferat og analyse

Lange møder, konferencer eller interviews kan transskriberes og sendes til modellen for opsummering, analyse eller handlingspunkt-ekstraktion. Med long context kan modellen arbejde med timevis af transskription i én forespørgsel.

Begrænsninger

“Lost in the middle”

Forskning har vist at mange long context-modeller er bedre til at bruge information i begyndelsen og slutningen af konteksten end information i midten. Denne “lost in the middle”-effekt betyder at modellen kan overse relevant information der befinder sig midt i en lang kontekst. Nyere modeller er dog blevet markant bedre til at håndtere dette problem.

Pris

Flere tokens i konteksten betyder højere pris. At sende 200.000 tokens til en model kan koste 10-100 gange mere end at sende 2.000 tokens. For opgaver der gentages mange gange (f.eks. et spørgsmål-svar-system der besvarer hundredvis af henvendelser) kan context caching reducere omkostningerne markant.

Latens

Mere kontekst kræver længere processering. Time to first token (TTFT) stiger med kontekstlængden, og for meget store kontekster kan der gå sekunder til minutter før modellen begynder at svare. Det er acceptabelt for dybe analyser men problematisk for interaktive anvendelser.

Ikke det samme som forståelse

At en model kan modtage 2 millioner tokens betyder ikke at den forstår eller husker alle detaljer med samme kvalitet. For komplekse, faktuelle opgaver er det stadig vigtigt at verificere modellens svar mod kildedokumenterne.

Fremtiden for long context

Endnu længere kontekster: Context windows på 10+ millioner tokens er under aktiv forskning. Det vil muliggøre analyse af hele arkiver, store kodebaser og omfattende dokumentsamlinger.

Bedre hukommelse: Modeller der ikke bare kan modtage lange kontekster men aktivt huske og organisere information over mange interaktioner. En form for persistent hukommelse der kombinerer long context med langtidshukommelse.

Lavere priser: Context caching, KV-cache optimering og hardware-forbedringer vil sænke prisen for long context-forespørgsler markant, hvilket gør det økonomisk for flere anvendelser.

Multimodale long context: Ikke kun tekst men også video, lyd og billeder i lange kontekster. Gemini kan allerede processere timevis af video som kontekst. En kapabilitet der vil modnes og blive standard.

Adaptiv kontekstbrug: Modeller der intelligent vurderer hvilke dele af konteksten der er mest relevante og fokuserer deres “opmærksomhed” derefter. I stedet for at behandle alle tokens lige.

Ofte stillede spørgsmål

Hvad er long context i AI?

Long context refererer til AI-modeller med ekstra store context windows (typisk fra 100.000 til flere millioner tokens) der kan behandle store mængder information i en enkelt forespørgsel. Hvor tidlige modeller var begrænset til et par sider tekst, kan moderne long context-modeller arbejde med hele bøger, store kodebaser og omfattende dokumentsamlinger. Det muliggør opgaver som at analysere en hel kontrakt, forstå en komplet kodebase eller opsummere timevis af mødetransskription i ét kald.

Hvad er forskellen på long context og RAG?

Long context sender hele dokumentet eller teksten direkte til modellen. Modellen ser alt og kan finde sammenhænge overalt. RAG (Retrieval-Augmented Generation) søger først i en stor samling og sender kun de mest relevante dele til modellen. Long context er simplere og mere grundig men dyrere og langsommere. RAG er billigere og hurtigere men kan misse relevante stykker. I praksis kombineres de ofte: RAG finder de rette dokumenter, og long context bruges til at analysere dem grundigt.

Hvor mange tokens kan AI-modeller håndtere?

Det varierer mellem modeller. Claude har 200.000 tokens som standard og op til 1 million via API. GPT-4.1 har 1 million tokens. Gemini 2.5 Pro har 1 million tokens med 2 millioner under udrulning. Tendensen er eksponentiel vækst. Context windows er blevet hundredvis af gange større på få år. Modeller med 10+ millioner tokens er under udvikling.

Er long context altid bedre end kort kontekst?

Ikke nødvendigvis. Mere kontekst koster mere penge, tager længere tid at processere, og modellen kan have sværere ved at finde en nål i en høstak af irrelevant tekst. For simple spørgsmål hvor kun lidt kontekst er nødvendig, er det både hurtigere, billigere og ofte mere præcist at sende kun den relevante kontekst. Long context exceller når hele dokumentet er relevant, eller når sammenhænge på tværs er vigtige.


Relaterede termer