Spring til indhold
AI Ordbog

AI Ordbog

Transformer

Den neurale netværksarkitektur der driver alle moderne sprogmodeller.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er en Transformer?

En Transformer er en type neurale netværksarkitektur der blev introduceret i 2017 og har forandret kunstig intelligens. Den er fundamentet bag alle moderne sprogmodeller (GPT, Claude, Gemini, BERT, Llama) og i stigende grad også bag billed- og videomodeller.

Navnet Transformer kommer fra det originale forskningspapir “Attention Is All You Need” fra Google, publiceret i 2017. Papiret foreslog en radikalt ny arkitektur der erstattede de dominerende RNN’er (Recurrent Neural Networks) med en mekanisme kaldet “self-attention”. Resultatet var en model der var markant hurtigere at træne og bedre til at fange sammenhænge i data.

“T” i GPT står for Transformer. “T” i BERT står for Transformer. Stort set enhver AI-model du bruger i dag er bygget på Transformer-arkitekturen. Det er ikke en overdrivelse at kalde det den vigtigste arkitektoniske innovation i AI’s historie.

Hvorfor var Transformers et gennembrud?

Før Transformers brugte man primært RNN’er til at behandle tekst. RNN’er læste tekst sekventielt (ét ord ad gangen, fra venstre mod højre) ligesom et menneske der læser. Det skabte to problemer:

  1. Langsom træning. Fordi hvert ord afhang af det forrige, kunne beregningerne ikke paralleliseres. Træning tog lang tid.
  2. Glemsomhed. RNN’er havde svært ved at huske information fra langt tilbage i en tekst. Hvis et vigtigt ord stod i starten af et langt dokument, var det ofte “glemt” når modellen nåede slutningen.

Transformers løste begge problemer med attention-mekanismen.

Hvordan fungerer en Transformer?

Transformer-arkitekturen har flere nøglekomponenter:

  1. Self-attention. Den centrale innovation. I stedet for at læse tekst ét ord ad gangen, kan modellen se hele teksten på én gang og beregne relationer mellem alle ord-par. Ordet “den” i sætningen “katten jagede musen fordi den var sulten” kan attention-mekanismen forbinde med “katten”, selvom ordene er langt fra hinanden.
  2. Multi-head attention. Modellen kører flere attention-beregninger parallelt, hver med sit eget fokus. Én “head” kan fokusere på grammatiske relationer, en anden på semantisk mening, en tredje på positional information. Det giver modellen et rigt, nuanceret billede af teksten.
  3. Positional encoding. Fordi Transformers ser hele teksten på én gang (i modsætning til RNN’er der læser sekventielt), har de brug for en måde at vide hvilken rækkefølge ordene står i. Positional encoding tilføjer information om hvert ords position i sætningen.
  4. Feed-forward lag. Efter attention-beregningen passerer data igennem traditionelle neurale netværkslag der transformerer repræsentationerne yderligere.
  5. Residual connections og normalisering. Tekniske mekanismer der gør det muligt at træne meget dybe netværk uden at signalet forsvinder.

Encoder og decoder

Det originale Transformer-design har to dele:

  1. Encoder. Læser og forstår input-teksten. Bruges i modeller som BERT, der er gode til at forstå og analysere tekst (klassifikation, navnegenkendelse, sentimentanalyse).
  2. Decoder. Genererer output-tekst ét token ad gangen. Bruges i modeller som GPT, der er gode til at generere tekst.
  3. Encoder-decoder. Den originale Transformer brugte begge dele sammen. Bruges i oversættelsesmodeller og T5.

GPT-serien og Claude bruger kun decoder-delen. BERT bruger kun encoder-delen. Valget af arkitektur afhænger af opgaven.

Skalering og scaling laws

En af de mest bemærkelsesværdige egenskaber ved Transformers er at de bliver konsekvent bedre når man gør dem større:

  1. Flere parametre. GPT-2 havde 1,5 milliarder parametre. GPT-3 havde 175 milliarder. GPT-4 har endnu flere. Hver gang modellen gøres større, forbedres kapabiliteten.
  2. Mere data. Større modeller kræver mere træningsdata, men de udnytter dataene også bedre.
  3. Mere beregningskraft. Transformers er designet til at udnytte parallel beregning, hvilket gør dem velegnede til moderne GPU’er og TPU’er.

Disse “scaling laws”, opdaget af forskere hos OpenAI, viste at man forudsigeligt kan forbedre modeller ved at skalere dem op. Det var denne indsigt der drev udviklingen af stadig større modeller og førte til gennembruddene vi ser i dag.

“Attention Is All You Need” Papiret bag Transformers blev publiceret af otte Google-forskere i juni 2017. Titlen var “Attention Is All You Need”, en påstand om at attention-mekanismen alene var tilstrækkelig til at bygge state-of-the-art modeller. De fik ret. Papiret er et af de mest citerede i AI’s historie, og dets forfattere har siden grundlagt eller ledet flere fremtrædende AI-virksomheder.

Transformers ud over tekst

Transformers er ikke begrænset til sprog:

  1. Vision Transformers (ViT). Anvender Transformer-arkitekturen på billeder ved at opdele dem i patches. Konkurrencedygtige med CNN’er til billedgenkendelse.
  2. Audio Transformers. Bruges i talegenkendelse (Whisper) og musikgenerering.
  3. Video Transformers. Bruges til videoforståelse og -generering (Sora).
  4. Multimodale Transformers. Modeller som GPT-4o og Gemini der behandler tekst, billeder, lyd og video i én samlet Transformer.

FAQ

Hvad er en Transformer i AI?

En Transformer er en neurale netværksarkitektur introduceret i 2017 der bruger en attention-mekanisme til at forstå relationer i data. Den er fundamentet for alle moderne sprogmodeller som GPT, Claude, Gemini og BERT. Navnet har intet med Transformers-filmene at gøre. Det refererer til at modellen "transformerer" input-data til output.

Hvad er attention-mekanismen?

Attention (opmærksomhed) er en teknik der lader modellen se hele inputtet på én gang og beregne hvilke dele der er vigtigst for hver del af outputtet. I stedet for at læse tekst ét ord ad gangen kan modellen fokusere på relevante ord uanset hvor de står i teksten, ligesom du kan skimme en side og fokusere på de vigtige afsnit.

Hvad er forskellen på en Transformer og en LLM?

En Transformer er en arkitektur: en specifik måde at bygge et neuralt netværk på. En LLM (Large Language Model) er en stor model bygget med den arkitektur. Forholdet er som mellem en byggeteknik og en bygning: Transformer er teknikken, GPT-4 er bygningen.

Hvorfor er Transformers bedre end RNN'er?

Transformers kan behandle hele teksten på én gang (parallelt) i stedet for ét ord ad gangen (sekventielt). Det gør dem meget hurtigere at træne og bedre til at fange sammenhænge mellem ord der er langt fra hinanden i teksten. Denne egenskab er afgørende for at bygge de store sprogmodeller vi har i dag.


Relaterede termer