AI Ordbog
Attention mechanism
Den mekanisme der lader AI-modeller fokusere på de mest relevante dele af input.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er attention?
Attention er den mekanisme der giver AI-modeller evnen til at fokusere. Ligesom du fokuserer på bestemte ord når du læser en sætning, fokuserer en AI-model med attention på de mest relevante dele af sit input når den genererer hvert ord i sit output.
Forestil dig at du skal oversætte sætningen “Katten sad på måtten” til engelsk. Når du oversætter ordet “cat,” fokuserer du primært på “Katten.” Når du oversætter “mat,” fokuserer du på “måtten.” Du fokuserer ikke lige meget på alle ord hele tiden, du retter din opmærksomhed mod de relevante dele. Det er præcis hvad attention gør i en AI-model.
Attention-mekanismen blev introduceret i 2014 til maskinoversættelse og blev i 2017 grundlaget for transformer-arkitekturen, den arkitektur der driver alle moderne sprogmodeller som GPT, Claude og Gemini. Det er ikke en overdrivelse at sige at attention er den vigtigste innovation i moderne AI.
Før attention: problemet
Før attention brugte AI-modeller til tekst recurrent neural networks (RNN’er) og LSTM’er. Disse modeller læste tekst sekventielt (ord for ord, fra venstre mod højre) og forsøgte at huske alt i en enkelt “tilstandsvektor.”
Problemet var flaskehalsen: hele inputsætningens betydning skulle komprimeres ned i én enkelt vektor. For korte sætninger fungerede det. For lange tekster gik vigtig information tabt. Modellen “glemte” hvad der stod i starten når den nåede slutningen.
Attention løste dette ved at lade modellen kigge direkte tilbage på alle input-ord når den genererer hvert output-ord. I stedet for at huske alt i én vektor, kan modellen dynamisk vælge hvilke dele af input der er relevante for hvert trin.
Hvordan fungerer attention?
Den intuitive forklaring
For hvert ord modellen skal generere:
- Se på alle input-ord. Modellen kigger på hvert ord i input.
- Beregn relevans. For hvert input-ord beregner modellen en “attention score”: hvor relevant er dette ord for det jeg skal generere lige nu?
- Vægt og kombiner. Input-ordene vægtes efter deres relevans-scores og kombineres til én repræsentation der bruges til at generere output-ordet.
De tre nøgler: Query, Key, Value
Attention fungerer via tre koncepter:
- Query (Q). “Hvad leder jeg efter?” Repræsenterer det aktuelle ord der skal genereres.
- Key (K). “Hvad indeholder jeg?” Repræsenterer hvert input-ord der kan fokuseres på.
- Value (V). “Hvad er min information?” Indeholdet der hentes når et input-ord matches.
Processen: Query sammenlignes med alle Keys for at beregne attention scores. Scores bruges til at vægte Values. Resultatet er en vægtet sum af Values. Den information modellen fokuserer på.
Analogi: tænk på det som en søgemaskine. Query er din søgning. Keys er overskrifterne på alle dokumenter. Values er dokumenternes indhold. Søgemaskinen matcher din søgning mod overskrifterne og returnerer indholdet fra de mest relevante dokumenter.
Attention scores
Attention scores beregnes typisk som:
- Dot product. Query-vektoren ganges med hver Key-vektor. Højt dot product = høj relevans.
- Skalering. Scores divideres med kvadratroden af dimensionen for at stabilisere beregningen.
- Softmax. Scores konverteres til sandsynligheder der summerer til 1 via softmax-funktionen. Nu er de “attention weights”: hvor meget opmærksomhed hvert input-ord får.
Self-attention: attention på sig selv
Den vigtigste variant af attention i moderne modeller er self-attention, hvor modellen fokuserer på sig selv snarere end en separat input-sekvens.
I self-attention er Query, Key og Value alle afledt fra den samme tekst. Hvert ord i sætningen “fokuserer på” alle andre ord i samme sætning for at forstå konteksten.
Eksempel med sætningen “Hunden jagtede katten fordi den var hurtig”:
- Når modellen processerer “den,” bruger self-attention til at afgøre hvad “den” refererer til. Attention-scoren mellem “den” og “Hunden” vil sandsynligvis være høj fordi det er hunden der er hurtig og jager.
- Uden attention ville modellen kun vide at “den” er et pronomen, ikke hvad det refererer til.
Self-attention er det der giver transformer-modeller deres evne til at forstå kontekst, relationer og referencer i tekst.
Multi-head attention
Moderne modeller bruger multi-head attention. Det er flere parallelle attention-mekanismer der kører samtidig:
- Hvorfor. Én attention-mekanisme kan kun fokusere på én type relation ad gangen. Multi-head attention lader modellen fokusere på flere ting parallelt.
- Hvordan. Input splittes i flere “hoveder” (typisk 8-128). Hvert hoved beregner sin egen attention uafhængigt. Resultaterne kombineres til sidst.
- Hvad de fanger. Forskellige hoveder lærer at fokusere på forskellige ting: ét hoved fokuserer på syntaktiske relationer (subjekt-verbum), et andet på semantiske relationer (synonymer), et tredje på nærhed (ord tæt på hinanden).
Modeller som GPT og Claude bruger hundredvis af attention-hoveder fordelt over mange lag. Det er det der giver dem deres dybe forståelse af sprog.
Attention i transformer-arkitekturen
Transformeren (arkitekturen bag alle moderne LLM’er) er bygget næsten udelukkende af attention:
- Input embedding. Tekst konverteres til vektorer.
- Positionsencoding. Information om ordenes rækkefølge tilføjes (attention selv er rækkefølge-agnostisk).
- Attention-lag. Mange lag af multi-head self-attention stakket oven på hinanden. Hvert lag raffinerer modellens forståelse.
- Feed-forward netværk. Mellem attention-lagene processerer simple neurale netværk informationen yderligere.
- Output. Det endelige lag genererer sandsynligheder for næste token.
Store sprogmodeller har typisk 100+ lag af attention. Hvert lag tilføjer dybere forståelse. Tidlige lag fanger grammatik og syntaks, sene lag fanger abstrakte koncepter og ræsonnementer.
Hvorfor attention ændrede AI fundamentalt
- Parallelisering. Før attention processerede RNN’er tekst sekventielt. Ord for ord. Attention processerer alle ord parallelt. Det udnytter GPU’ens massive parallelisme og gør træning tusindvis af gange hurtigere.
- Lange afhængigheder. RNN’er havde svært ved at huske information fra starten af en lang tekst. Attention forbinder hvert ord direkte med alle andre ord. Uanset afstand.
- Skalerbarhed. Attention-baserede modeller (transformere) skalerer bedre med mere data og compute. Det er grunden til at vi kan træne modeller med hundredvis af milliarder parametre.
- Fleksibilitet. Attention virker for tekst, billeder, lyd, video og kombinationer. Den samme grundmekanisme driver sprogmodeller, billedgeneratorer og multimodale modeller.
Attention i praksis
Sprogforståelse
Når Claude læser din besked, bruger attention til at forstå konteksten:
- I “Banken lukkede tidligt på grund af oversvømmelsen” forstår attention at “banken” refererer til en finansinstitution (på grund af “lukkede”) eller en flodbred (på grund af “oversvømmelsen”) baseret på konteksten.
- Attention forbinder “oversvømmelsen” med “banken” og “lukkede” for at danne en sammenhængende forståelse.
Tekstgenerering
Når en sprogmodel genererer tekst, bruger attention til at holde svaret kohærent:
- Modellen husker hvad den allerede har skrevet og sikrer at nye sætninger er konsistente.
- Hvis den nævner “tre grunde” i starten, bruger attention til at holde styr på at den dækker alle tre grunde.
Billedgenkendelse (Vision Transformers)
Attention bruges også i computer vision:
- Et billede opdeles i patches (små firkanter).
- Attention beregnes mellem alle patches, modellen fokuserer på de relevante dele af billedet.
- For at genkende en hund fokuserer modellen på hundens ansigt og krop, ikke på baggrunden.
Billedgenerering
I diffusion-modeller (Stable Diffusion, DALL-E) styrer attention hvilke dele af prompten der påvirker hvilke dele af billedet:
- Cross-attention forbinder ord i prompten med regioner i billedet.
- “En rød bil på en strand”: attention sikrer at “rød” påvirker bilens farve og “strand” påvirker baggrunden.
Context window og attention
Context window (den maksimale inputlængde en model kan håndtere) er direkte relateret til attention:
- Quadratic complexity. Standard attention beregner relationer mellem alle par af tokens. Med N tokens er det N² beregninger. 1.000 tokens = 1 million beregninger. 100.000 tokens = 10 milliarder beregninger.
- Hukommelse. Attention-matricen (KV-cache) vokser med kontekstlængden. Lange kontekster kræver enormt meget GPU-hukommelse.
- Efficient attention. Nyere teknikker reducerer kompleksiteten: Flash Attention (optimeret hukommelsesbrug), Sparse Attention (beregn kun relevante par), Sliding Window Attention (fokuser kun på nærliggende tokens).
KV-cache
Under tekstgenerering gemmer modellen Keys og Values fra tidligere tokens i en KV-cache:
- Hvorfor. Når modellen genererer token nummer 500, behøver den ikke genberegne attention for de første 499 tokens. Den genbruger deres Keys og Values fra cachen.
- Hukommelsesforbrug. KV-cachen kan fylde gigabytes for lange kontekster. Det er ofte den begrænsende faktor for kontekstlængde.
- Optimering. Teknikker som paged attention (vLLM) og grouped-query attention reducerer KV-cachens størrelse.
Attention er AI’s evne til at fokusere Før attention var AI-modeller som en studerende der forsøgte at huske en hel lærebog i hovedet, uundgåeligt gik detaljer tabt. Attention gav modeller evnen til at slå op: i stedet for at huske alt, kan de fokusere på præcis den information der er relevant for opgaven. Det er denne enkle men kraftfulde idé (dynamisk fokus baseret på kontekst) der muliggjorde transformer-arkitekturen og dermed hele den moderne AI-udvikling. “Attention Is All You Need” var titlen på det originale paper fra 2017. Det viste sig at være sandt.
FAQ
Hvad er attention mechanism i AI?
Attention er en mekanisme der lader AI-modeller fokusere på de mest relevante dele af deres input når de genererer output. I stedet for at behandle alle input-ord lige meget, beregner modellen dynamisk hvor meget opmærksomhed hvert ord fortjener baseret på konteksten. Det er fundamentet for transformer-arkitekturen bag alle moderne sprogmodeller.
Hvorfor er attention så vigtigt for AI?
Attention løste to fundamentale problemer: det fjernede flaskehalsen hvor hele inputtets betydning skulle komprimeres til én vektor, og det muliggjorde parallel processering (i stedet for sekventiel). Det er grunden til at vi kan træne og køre de enorme sprogmodeller der driver ChatGPT, Claude og Gemini.
Hvad er forskellen på attention og self-attention?
Attention i bred forstand er enhver mekanisme der dynamisk fokuserer på relevante dele af input. Self-attention er den specifikke variant hvor modellen fokuserer på sig selv, hvert ord i en sætning "kigger på" alle andre ord i samme sætning for at forstå kontekst og relationer. Self-attention er den primære mekanisme i transformer-modeller.
Hvad betyder "Attention Is All You Need"?
Det er titlen på det paper fra Google i 2017 der introducerede transformer-arkitekturen. Paperet viste at en model bygget udelukkende på attention-mekanismer (uden RNN'er eller CNN'er) kunne opnå state-of-the-art resultater. Denne arkitektur blev fundamentet for GPT, BERT, Claude og alle moderne sprogmodeller.