Spring til indhold
AI Ordbog

AI Ordbog

Epoch

Ét komplet gennemløb af hele træningsdatasættet under modeltræning.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er en epoch?

En epoch er ét komplet gennemløb af hele træningsdatasættet. Når modellen har set hvert eneste træningseksempel præcis én gang, er det én epoch.

Forestil dig en studerende der læser en lærebog. Første gang hun læser bogen er første epoch. Hun ser alt materialet én gang. Anden gennemlæsning er anden epoch. Hun ser det samme materiale igen men opfanger flere nuancer. Tredje gennemlæsning er tredje epoch. For hver gennemlæsning forstår hun materialet lidt bedre, men på et tidspunkt begynder hun at memorere sætninger i stedet for at forstå koncepterne. Det er overfitting.

Epoker, batches og steps

Tre relaterede begreber der beskriver træningens progression:

Epoch

Hele datasættet set én gang.

Batch

En delmængde af datasættet der processeres ad gangen. Typisk 32-4096 eksempler.

Step (iteration)

Én enkelt opdatering af modellens vægte baseret på én batch.

Sammenhængen

Hvis du har 10.000 træningseksempler og en batch size på 100:

  • 1 epoch = 10.000 / 100 = 100 steps
  • 5 epoker = 500 steps
  • Ved hvert step processerer modellen 100 eksempler og opdaterer sine vægte.

Mere generelt: steps per epoch = datasætstørrelse / batch size

Hvad sker der under en epoch?

  1. Shuffling. Træningsdata blandes i tilfældig rækkefølge i starten af hver epoch. Det forhindrer modellen i at lære rækkefølge-afhængige mønstre.
  2. Batch-opdeling. Data opdeles i batches.
  3. Forward pass. Hver batch sendes gennem modellen. Output beregnes.
  4. Loss-beregning. Fejlen måles for hver batch.
  5. Backward pass. Backpropagation beregner gradienter.
  6. Vægt-opdatering. Gradient descent opdaterer modellens parametre.
  7. Gentag. For hver batch i datasættet.
  8. Epoch færdig. Når alle batches er processeret, er epochen færdig.

Hvorfor flere epoker?

En model lærer sjældent nok efter kun én epoch:

Epoch 1

Modellen ser hvert eksempel for første gang. Den lærer de mest grundlæggende mønstre: “billeder med fire ben er ofte dyr,” “sætninger der starter med ‘hvad’ er ofte spørgsmål.”

Epoch 2-5

Modellen raffinerer sin forståelse. Finere nuancer opfanges: “golden retrievere har typisk gyldent pæls,” “retoriske spørgsmål har en anden struktur end informationsspørgsmål.”

Epoch 5-20

Modellen finjusterer yderligere. Marginale forbedringer. Risikoen for overfitting vokser.

Epoch 20+

Forbedringerne er minimale. Modellen begynder at memorere specifikke eksempler. Overfitting er sandsynligt.

Hvor mange epoker?

Antallet afhænger markant af opgaven og datamængden:

Store sprogmodeller (pre-training)

  1. Typisk: under 1 epoch. Datamængden er så enorm (hundredvis af milliarder tokens) at modellen ofte ikke ser alt data. Der er simpelthen mere data end der er compute-budget til.
  2. Chinchilla-scaling. Forskning viser at det er bedre at se mere unik data én gang end at se mindre data flere gange. Data ses typisk 1-2 gange.
  3. Undtagelse. Når data er begrænset, trænes modeller i 2-4 epoker, men med risiko for memorering.

Fine-tuning af sprogmodeller

  1. Typisk: 1-5 epoker. Fine-tuning datasæt er små (hundreder til tusinder af eksempler). Få epoker er nok, og flere fører hurtigt til overfitting.
  2. Med LoRA/PEFT: 1-3 epoker. Endnu færre fordi der er færre parametre at opdatere.

Billedklassifikation

  1. Typisk: 10-100 epoker. Billeddata tåler flere gennemløb, særligt med data augmentation der gør hvert gennemløb lidt anderledes.
  2. Med pretrained model: 5-20 epoker. Transfer learning kræver færre epoker fordi modellen allerede kan det grundlæggende.

Klassisk maskinlæring

  1. Typisk: 10-1000 epoker. Små datasæt og simple modeller kan drage fordel af mange gennemløb.

Epoker og overfitting

Der er en direkte sammenhæng mellem antal epoker og overfitting:

Tidlige epoker (underfit-zone)

  • Modellen lærer generelle mønstre.
  • Både trænings-loss og validerings-loss falder.
  • Modellen er endnu ikke god nok.

Optimale epoker (sweet spot)

  • Modellen har lært de vigtigste mønstre.
  • Validerings-loss er på sit laveste.
  • Det er her du bør stoppe.

Sene epoker (overfit-zone)

  • Trænings-loss fortsætter med at falde.
  • Validerings-loss begynder at stige.
  • Modellen memorerer træningsdata og mister evnen til at generalisere.

Early stopping

Den mest brugte teknik til at finde det rigtige antal epoker automatisk:

  1. Monitorér validerings-loss efter hver epoch.
  2. Gem modellen når validerings-loss er lavest.
  3. Stop træning hvis validerings-loss ikke forbedres i N epoker (patience).
  4. Brug den gemte model, ikke den fra den sidste epoch.

Data augmentation og epoker

Data augmentation gør det muligt at træne i flere epoker uden overfitting:

  1. Billeddata. Hvert billede transformeres tilfældigt (rotation, spejling, beskæring, farveændring). Modellen ser en lidt anderledes version hver epoch. Det reducerer memorering.
  2. Tekstdata. Sætninger omformuleres, ord erstattes med synonymer, rækkefølge varieres. Modellen ser nye variationer hvert gennemløb.
  3. Effekt. Med aggressiv augmentation kan du træne i 2-3x flere epoker før overfitting begynder.

Epoker i praksis

Eksempel: fine-tuning af en kundesupport-chatbot

  1. Data. 2.000 spørgsmål-svar par.
  2. Batch size. 16.
  3. Steps per epoch. 2.000 / 16 = 125 steps.
  4. 3 epoker. 375 steps total. Modellen ser hvert eksempel 3 gange.
  5. Evaluering. Validerings-loss stiger fra epoch 3 til 4 → stop ved 3.

Eksempel: træning af billedklassifikation

  1. Data. 50.000 billeder med data augmentation.
  2. Batch size. 256.
  3. Steps per epoch. 50.000 / 256 ≈ 195 steps.
  4. 30 epoker. ~5.850 steps. Med augmentation ser modellen et unikt transformeret billede hver gang.
  5. Early stopping. Bedste validerings-accuracy i epoch 22. Stopper i epoch 32 (patience: 10).

Eksempel: GPT-4 pre-training

  1. Data. Trillioner af tokens.
  2. Batch size. Millioner af tokens per step.
  3. Epoker. Sandsynligvis under 1. Modellen ser muligvis ikke hele datasættet.
  4. Steps. Hundredtusindvis af steps over uger af compute.

Epoch vs. step: hvad skal man rapportere?

I moderne AI bruges steps ofte i stedet for epoker:

  1. Epoker er meningsfulde når datasættet er fast og veldefineret. “Vi trænede i 5 epoker” fortæller præcis hvor mange gange data blev set.
  2. Steps er mere meningsfulde for store modeller med streaming data eller variabel datasætstørrelse. “Vi trænede i 500.000 steps” er uafhængigt af datasætstørrelse.
  3. Tokens er det mest præcise for sprogmodeller. “Vi trænede på 1.5 trillioner tokens” fortæller den faktiske mængde data modellen har set.

En epoch er træningens grundenhed Ligesom et skoleår er en naturlig enhed for uddannelse, er en epoch en naturlig enhed for AI-træning: ét komplet gennemløb af alt materiale. At finde det rette antal epoker er en af de mest basale men vigtige beslutninger i modeltræning. For få og modellen har ikke lært nok, for mange og den memorerer i stedet for at forstå. Det elegante ved early stopping er at den automatiserer denne beslutning: træn indtil modellen stopper med at forbedre sig på nye data, og gem det bedste checkpoint.


FAQ

Hvad er en epoch i maskinlæring?

En epoch er ét komplet gennemløb af hele træningsdatasættet. Hvis du har 10.000 træningseksempler, er én epoch det punkt hvor modellen har set alle 10.000 eksempler præcis én gang. Modeller trænes typisk i flere epoker for at forbedre kvaliteten.

Hvor mange epoker skal man træne?

Det afhænger af opgaven. Fine-tuning af sprogmodeller: 1-5 epoker. Billedklassifikation: 10-100 epoker. Store sprogmodellers pre-training: ofte under 1 epoch. Brug early stopping med et valideringsdatasæt til at finde det optimale antal automatisk.

Hvad er forskellen på en epoch og en batch?

En epoch er ét gennemløb af hele datasættet. En batch er en delmængde der processeres ad gangen. Hvis du har 10.000 eksempler og batch size 100, kræver det 100 batches (steps) at gennemføre én epoch.

Hvad sker der med for mange epoker?

For mange epoker fører typisk til overfitting: modellen memorerer træningsdata i stedet for at lære generelle mønstre. Symptomerne er at trænings-loss falder men validerings-loss stiger. Early stopping er den mest effektive løsning.


Relaterede termer