Spring til indhold
AI Ordbog

AI Ordbog

Overfitting

Når en AI-model memorerer træningsdata i stedet for at lære generelle mønstre.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er overfitting?

Overfitting er når en AI-model bliver for god til sin træningsdata. Så god at den memorerer de specifikke eksempler i stedet for at lære de underliggende mønstre. Den præsterer godt på data den har set før, men fejler på ny data.

Forestil dig en studerende der forbereder sig til en eksamen ved at memorere alle svarene i en opgavesamling. Ord for ord. Til eksamen klarer hun sig perfekt på spørgsmål der er identiske med opgavesamlingen. Men når et spørgsmål er formuleret lidt anderledes, fejler hun, fordi hun aldrig lærte de underliggende koncepter.

Det er præcis hvad overfitting er i AI. Modellen “husker” træningsdata i stedet for at “forstå” mønstrene i dem.

Hvorfor er overfitting vigtigt?

  1. Det er det mest universelle problem i maskinlæring. Næsten alle modeller risikerer at overfitte. Det er ikke et edge case. Det er den centrale udfordring.
  2. Ubrugelig model. En overfittet model er værdiløs i produktion. Den ser god ud under træning men fejler på rigtige data.
  3. Falsk tillid. Overfitting kan skabe en illusion af succes. Trænings-metrics ser gode ud, men den reelle ydeevne er dårlig.
  4. Spild af ressourcer. Tid og GPU-compute brugt på at overfitte er spildt. Modellen skal trænes igen med bedre regularisering.

Hvornår sker overfitting?

For lidt data, for stor model

Det klassiske scenarie. En model med millioner af parametre trænet på tusind eksempler har kapacitet til at memorere hvert enkelt eksempel. Der er simpelthen ikke nok data til at tvinge modellen til at generalisere.

Træning for længe

Selv med tilstrækkelig data kan overfitting ske hvis modellen trænes for mange epoker. I starten lærer modellen generelle mønstre. Senere begynder den at tilpasse sig støj og tilfældigheder i data.

For kompleks model

En model med for mange lag, neuroner eller parametre i forhold til opgavens kompleksitet har overskudskapacitet der bruges til at memorere i stedet for at generalisere.

Støjende data

Hvis træningsdata indeholder fejl, outliers eller irrelevant information, kan modellen lære at tilpasse sig denne støj som om det var ægte mønstre.

Sådan opdager du overfitting

Trænings-loss vs. validerings-loss

Den primære metode: plot loss over tid for både træningsdata og valideringsdata (data modellen ikke har set under træning):

  1. Normal træning. Begge loss-kurver falder sammen. Modellen lærer generelle mønstre der gælder for begge datasæt.
  2. Overfitting begynder. Trænings-loss fortsætter med at falde, men validerings-loss begynder at stige. Modellen forbedrer sig på træningsdata men forværres på ny data.
  3. Svær overfitting. Stort gap mellem de to kurver. Trænings-loss er tæt på 0, validerings-loss er høj.

Train-test gap

  1. Træn modellen.
  2. Mål performance (accuracy, loss, F1-score) på træningsdata.
  3. Mål performance på et separat testdatasæt.
  4. Hvis der er en stor forskel (f.eks. 98% accuracy på træning, 75% på test), overfitter modellen.

Lyt efter urealistisk god performance

Hvis din model pludselig når 99.9% accuracy på en kompleks opgave, er det sandsynligvis overfitting. Rigtige problemer har sjældent perfekte løsninger.

Overfitting vs. underfitting

OverfittingUnderfitting
ProblemModellen er for kompleksModellen er for simpel
SymptomGod på træningsdata, dårlig på nye dataDårlig på begge
AnalogiMemorerer svareneForstår ikke spørgsmålene
LøsningRegularisering, mere data, enklere modelStørre model, bedre features, længere træning
Loss-kurverTræning falder, validering stigerBegge forbliver høje

Den ideelle model er i balancen mellem de to. Kompleks nok til at fange de vigtige mønstre, men ikke så kompleks at den memorerer støj.

Teknikker mod overfitting

1. Mere data

Den mest effektive løsning. Mere data giver modellen flere eksempler at generalisere fra og gør det sværere at memorere alt.

  • Data augmentation. Udvid datasættet kunstigt: rotér billeder, tilføj støj, omformulér tekst, mix eksempler. Et billede af en hund er stadig en hund uanset om det er spejlvendt, beskåret eller mørkere.
  • Syntetiske data. Generer nye eksempler med AI eller simulering.
  • Mere indsamling. Saml flere rigtige eksempler.

2. Regularisering

Teknikker der straffer modellen for at være for kompleks:

  • L2 regularisering (weight decay). Tilføj en straf til loss function for store vægte. Tvinger modellen til at bruge små, simple vægte. Standarden i AdamW optimizer.
  • L1 regularisering. Tilsvarende straf men tvinger mange vægte til at blive præcis nul. Giver en sparser model.
  • Effekt. Modellen kan stadig lære komplekse mønstre men afholdes fra at tilpasse sig støj via ekstreme parameterværdier.

3. Dropout

Sluk tilfældige neuroner under træning:

  1. I hvert træningstrin deaktiveres en tilfældig del af neuronerne (typisk 10-50%).
  2. Modellen tvinges til at være robust. Den kan ikke afhænge af individuelle neuroner.
  3. Under inference bruges alle neuroner.
  4. Effekt: modellen lærer redundante repræsentationer der generaliserer bedre.

4. Early stopping

Stop træningen før overfitting begynder:

  1. Monitorér validerings-loss under træning.
  2. Gem modellen ved det punkt hvor validerings-loss er lavest.
  3. Stop når validerings-loss ikke har forbedret sig i N epoker (patience).
  4. Brug den gemte model. Ikke den seneste.

5. Enklere model

Reducer modellens kapacitet:

  1. Færre lag og færre neuroner.
  2. Færre parametre.
  3. Brug en model der matcher opgavens kompleksitet. Du behøver ikke et neuralt netværk med millioner af parametre til at skelne mellem to kategorier.

6. Cross-validation

Evaluer modellen på flere forskellige opdelinger af data:

  1. Del data i K dele (folds).
  2. Træn på K-1 dele, evaluer på den sidste.
  3. Gentag K gange med forskellige folds.
  4. Gennemsnittet giver et mere pålideligt mål for modellens evne til at generalisere.

7. Batch normalization

Normaliser aktiveringsværdier mellem lag:

  1. Stabiliserer træningen.
  2. Har en regulariserende effekt der reducerer overfitting.
  3. Tillader brug af højere learning rates.

Overfitting i sprogmodeller

Store sprogmodeller overfitter sjældent under pre-training fordi:

  1. Enorme datamængder. Hundredvis af milliarder tokens. Langt mere end modellen kan memorere.
  2. Én epoke. De fleste sprogmodeller ser hvert træningseksempel kun én gang (eller få gange). Med nok data er der ikke tid til at memorere.
  3. Modellens kapacitet. Selvom modellerne er store, er datamængden endnu større.

Men overfitting er et reelt problem ved:

Fine-tuning

  1. Scenariet. Du fine-tuner en sprogmodel på 1.000 virksomheds-specifikke eksempler.
  2. Risiko. Modellen memorerer de 1.000 eksempler og mister sin generelle kapabilitet.
  3. Løsning. LoRA (kun justér en lille del af parametrene), kort træning, lav learning rate.

Small data tasks

  1. Scenariet. Træn en klassificeringsmodel på 500 kundehenvendelser.
  2. Risiko. Modellen lærer specifikke formuleringer i stedet for generelle mønstre.
  3. Løsning. Data augmentation, brug af pre-trained modeller (transfer learning), regularisering.

Overfitting i praksis

Eksempel: billedklassifikation

  1. Opgave. Skelne mellem hunde og katte. 100 træningsbilleder.
  2. Overfitting. Modellen lærer at alle hunde i træningsdata har grøn baggrund og alle katte har hvid baggrund. Den klassificerer baseret på baggrund. Ikke på dyret.
  3. Resultat. 100% accuracy på træning. 50% på nye billeder (tilfældig gætning).
  4. Løsning. Mere diverse data, data augmentation (variér baggrunde), regularisering.

Eksempel: spam-filter

  1. Opgave. Klassificér emails som spam/ikke-spam. Lille datasæt.
  2. Overfitting. Modellen lærer at emails fra “john@spammer.com” er spam. Den memorerer afsenderadresser i stedet for at lære spam-mønstre.
  3. Resultat. Perfekt på historiske emails. Mislykkes på nye spammere.
  4. Løsning. Fjern afsenderadresser fra features, mere data, regularisering.

Eksempel: fine-tuning af LLM

  1. Opgave. Fine-tune Claude til at svare på juridiske spørgsmål. 500 eksempler.
  2. Overfitting. Modellen memorerer de 500 eksempler. Genererer svar der er kopier af træningsdata.
  3. Resultat. Perfekt på kendte spørgsmål. Meningsløse svar på nye spørgsmål. Mister generel samtaleevne.
  4. Løsning. LoRA, early stopping, lav learning rate, mere data.

Bias-variance tradeoff

Overfitting hænger sammen med et fundamentalt koncept i maskinlæring:

  1. Bias. Fejl fra for simple antagelser. Høj bias = underfitting. Modellen er for simpel til at fange mønstrene.
  2. Variance. Fejl fra for høj følsomhed over for træningsdata. Høj variance = overfitting. Modellen er for følsom over for de specifikke eksempler.
  3. Tradeoff. Reducér bias (mere kompleks model) og variance stiger. Reducér variance (simplere model) og bias stiger. Kunsten er at finde balancen.

Overfitting er AI’s vigtigste lektion Det er nemt at bygge en model der scorer perfekt på træningsdata. Det svære er at bygge en model der fungerer på data den aldrig har set. Overfitting minder os om at formålet med AI ikke er at huske fortiden men at forudsige fremtiden. Enhver AI-udvikler har oplevet den skuffelse: en model der ser perfekt ud i laboratoriet men fejler i virkeligheden. At forstå og forhindre overfitting er forskellen mellem en model der virker og en der bare ser ud som om den virker.


FAQ

Hvad er overfitting?

Overfitting er når en AI-model lærer træningsdata for godt. Den memorerer specifikke eksempler i stedet for at lære generelle mønstre. Resultatet er en model der præsterer godt på træningsdata men dårligt på nye, usete data. Det er et af de mest centrale problemer i maskinlæring.

Hvordan opdager man overfitting?

Den mest pålidelige metode er at sammenligne performance på træningsdata med performance på et separat valideringsdatasæt. Hvis trænings-performance er markant bedre end validerings-performance (f.eks. 98% vs. 75% accuracy), overfitter modellen. Plot af trænings-loss vs. validerings-loss viser det tydeligt.

Hvad er forskellen på overfitting og underfitting?

Overfitting: modellen er for kompleks. Memorerer data, god på træning, dårlig på nye data. Underfitting: modellen er for simpel. Fanger ikke mønstrene, dårlig på begge. Overfitting løses med regularisering og mere data. Underfitting løses med en mere kapabel model.

Hvordan forhindrer man overfitting?

De vigtigste teknikker er: mere og mere divers træningsdata, regularisering (weight decay, dropout), early stopping (stop træning før overfitting begynder), data augmentation (udvid datasættet kunstigt) og at vælge en passende modelstørrelse til opgaven.


Relaterede termer