Spring til indhold
AI Ordbog

AI Ordbog

Pre-training

Den indledende, massive træningsfase der giver en AI-model sin grundlæggende viden.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er pre-training?

Pre-training (præ-træning på dansk) er den første og mest ressourcekrævende fase i træningen af en AI-model. Det er her modellen lærer alt det grundlæggende: sprog, fakta, ræsonnement, kodning og verdensviden, ved at analysere enorme mængder data.

Tænk på pre-training som en bred universitetsuddannelse der dækker alt fra historie og naturvidenskab til litteratur og matematik. Modellen læser billioner af tokens (bøger, websites, kode, akademiske artikler) og lærer de underliggende mønstre og strukturer i sprog og viden.

Pre-training er det der gør foundation models mulige. Uden pre-training ville hver AI-model skulle trænes fra bunden til hver enkelt opgave. Med pre-training kan én bred model tilpasses til hundredvis af opgaver via billig fine-tuning.

Hvordan fungerer pre-training?

For sprogmodeller er pre-training-processen overraskende enkel i sit grundprincip:

  1. Data. Enorme mængder tekst indsamles. Typisk billioner af tokens fra internettet, bøger, kode, Wikipedia, akademiske artikler og mere. Dataen renses og filtreres for at fjerne duplikater, lavkvalitetsindhold og skadeligt materiale.
  2. Opgave. Modellen trænes på en simpel opgave: forudsig det næste token. Givet “Den danske hovedstad er”, skal modellen lære at “København” er det mest sandsynlige næste token. Denne simple opgave, gentaget billioner af gange, tvinger modellen til at lære sprog, fakta, logik og ræsonnement.
  3. Optimering. For hvert eksempel beregner modellen sit gæt, sammenligner med det korrekte token og justerer sine milliarder af parametre for at reducere fejlen. Denne proces gentages med en enorm mængde data.
  4. Skala. Pre-training kører typisk i uger eller måneder på tusindvis af GPU’er eller TPU’er. Den samlede beregning kan svare til millioner af GPU-timer.

Hvad lærer modellen under pre-training?

Under pre-training opbygger modellen en bred videnbase:

  1. Sprogforståelse. Grammatik, syntaks, semantik, idiomer og sproglige nuancer. Modellen lærer at “han sparker bolden” er mere sandsynligt end “bolden sparker ham”. Uden nogensinde at få en grammatikregel.
  2. Faktuel viden. Modellen absorberer fakta fra sine træningsdata: hovedstæder, historiske begivenheder, videnskabelige koncepter, biografier. Den ved at “Einstein udviklede relativitetsteorien” fordi den har set det mange gange.
  3. Ræsonnement. Ved at se millioner af eksempler på logiske argumenter lærer modellen at ræsonnere. I hvert fald til en vis grad. Den kan løse matematikopgaver, drage logiske konklusioner og analysere argumenter.
  4. Kodning. Modeller trænet på kode lærer programmeringssprog, designmønstre og debugging-strategier.
  5. Verdensviden. Modellen opbygger en implicit model af verden. Den ved at vand er vådt, at mennesker har følelser, og at det er koldt om vinteren i Danmark.

Hvad koster pre-training?

Pre-training er ekstremt dyrt:

  1. Beregning. GPT-4 kostede estimeret over 100 millioner dollars bare i beregningskraft. Llama 3 405B brugte over 30 millioner GPU-timer.
  2. Hardware. Tusindvis af NVIDIA H100 eller A100 GPU’er, hver til titusindvis af dollars. En typisk træningsklynge koster hundredvis af millioner at bygge.
  3. Energi. Et enkelt træningsløb kan bruge millioner af kilowatt-timer elektricitet.
  4. Data. Indsamling, rensning og kuratoring af billioner af tokens kræver store teams og avancerede pipelines.
  5. Mennesker. Forskere, ingeniører og infrastruktur-specialister der designer, overvåger og fejlsøger træningen.

Hvorfor “pre”-training? Præfikset “pre” understreger at dette er forberedelse. Ikke slutproduktet. Pre-training skaber fundamentet, men modellen er endnu ikke en nyttig assistent. Den kan forudsige næste token, men den følger ikke instruktioner. Den kender fakta, men den hallucinerer også frit. Det er de efterfølgende trin (supervised fine-tuning, RLHF og alignment) der gør den til en brugbar model.

Pre-training-teknikker

  1. Causal Language Modeling (CLM). Forudsig det næste token baseret på de foregående. Bruges af GPT-serien og Claude. Modellen læser tekst fra venstre mod højre og forudsiger hvad der kommer næst.
  2. Masked Language Modeling (MLM). Maskér tilfældige tokens i teksten og forudsig hvad der mangler. Bruges af BERT. Modellen ser kontekst fra begge sider af det maskerede token.
  3. Denoising. Korrumpér inputtet på forskellige måder og lad modellen rekonstruere det originale. Bruges af T5 og BART.

Pre-training vs. fine-tuning

  1. Data. Pre-training: billioner af tokens, bred og ustruktureret. Fine-tuning: tusindvis til millioner af tokens, specifikt og kurateret.
  2. Omkostning. Pre-training: hundredvis af millioner dollars. Fine-tuning: hundreder til tusinder af dollars.
  3. Tid. Pre-training: uger til måneder. Fine-tuning: timer til dage.
  4. Formål. Pre-training: bred videnbase og sprogforståelse. Fine-tuning: specialisering til specifikke opgaver.

FAQ

Hvad er pre-training?

Pre-training er den indledende, massive træningsfase hvor en AI-model læser enorme mængder data og lærer sprog, fakta og ræsonnement. Det er fundamentet for modeller som GPT-4, Claude og Llama. Pre-training er ekstremt dyrt og tidskrævende men nødvendigt for at skabe kapable AI-modeller.

Hvad er forskellen på pre-training og fine-tuning?

Pre-training er den brede, dyre initielle træning på enorme datamængder. Fine-tuning er den efterfølgende, billige tilpasning til specifikke opgaver med mindre datasæt. Pre-training koster hundredvis af millioner dollars, fine-tuning koster hundreder til tusinder. Pre-training tager uger, fine-tuning tager timer.

Hvor meget data bruges til pre-training?

Moderne frontier-modeller trænes typisk på billioner af tokens, svarende til millioner af bøger. GPT-4 og Claude er trænet på en betydelig del af internettets tekst plus bøger, kode og akademiske artikler. Datakvalitet er mindst lige så vigtig som datamængde.

Kan man pre-traine sin egen model?

I praksis kun hvis du er en stor virksomhed med hundredvis af millioner dollars i kapital. Men du kan fine-tune eksisterende open source-modeller som Llama og Mistral til dine behov for en brøkdel af prisen, og det er hvad de fleste gør.


Relaterede termer