AI Ordbog
Catastrophic forgetting
Et fænomen hvor neurale netværk glemmer tidligere lært viden når de trænes på nye opgaver eller data.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er catastrophic forgetting?
Catastrophic forgetting (katastrofal glemsel) er et fænomen hvor neurale netværk glemmer tidligere lært viden når de trænes på nye opgaver eller data. Det sker fordi ny træning opdaterer de samme vægte i netværket der indeholdt den gamle viden, og de nye opdateringer overskriver de gamle mønstre.
Forestil dig at du lærer at tale spansk flydende og derefter bruger et år udelukkende på at lære mandarin. Når du vender tilbage til spansk, vil du opdage at du har glemt meget af det. Det der sker i neurale netværk er en langt mere ekstrem version: netværket kan miste stort set al tidligere viden på meget kort tid.
Catastrophic forgetting er en af de mest fundamentale forskelle mellem menneskelig læring og maskinlæring. Mennesker kan lære nye færdigheder uden at glemme gamle. Vi kan lære at køre bil uden at glemme at cykle. Neurale netværk har denne evne i langt mindre grad.
Hvorfor sker catastrophic forgetting?
Det tekniske grundlag
Neurale netværk lagrer viden i deres vægte. De numeriske parametre der forbinder neuroner i netværket. Når netværket trænes på opgave A, justeres vægtene til at løse opgave A godt. Når det derefter trænes på opgave B, justeres de samme vægte til at løse opgave B, og i processen ødelægges de præcise konfigurationer der løste opgave A.
Fase 1: Træning på opgave A
- Vægte justeres: w₁=0.7, w₂=-0.3, w₃=0.5
- Performance på A: 95%
Fase 2: Træning på opgave B (med samme netværk)
- Vægte justeres: w₁=-0.2, w₂=0.8, w₃=0.1
- Performance på B: 92%
- Performance på A: 30% ← Catastrophic forgetting!
Problemet er at vægtene er delte ressourcer. De skal repræsentere viden om alle opgaver simultant, men gradient descent-optimeringen fokuserer udelukkende på den aktuelle opgave og ignorerer at ændringerne ødelægger viden om tidligere opgaver.
Hvorfor er mennesker bedre?
Menneskehjernen undgår catastrophic forgetting via flere mekanismer:
Komplementære læringssystemer: Hjernen har separate systemer for hurtig læring (hippocampus) og langsom konsolidering (neocortex). Ny information lagres først midlertidigt og integreres gradvist med eksisterende viden.
Sparse repræsentationer: Forskellige koncepter aktiverer forskellige grupper af neuroner. At lære noget nyt berører ikke de neuroner der repræsenterer gammel viden.
Sov og konsolidering: Under søvn genafspiller hjernen tidligere oplevelser og integrerer ny viden med gammel, uden at overskrive.
Neurale netværk mangler disse mekanismer. Al viden er distribueret over alle vægte, og ny træning påvirker alle vægte simultant.
Catastrophic forgetting i praksis
Fine-tuning af sprogmodeller
Det mest udbredte eksempel i dag: Når en stor sprogmodel (som GPT eller Claude) finjusteres til en specifik opgave, kan den miste generelle kapabiliteter:
Eksempel: En virksomhed finjusterer en sprogmodel på kundeservice-data for at forbedre dens evne til at besvare kundehenvendelser. Efter finjustering er modellen bedre til kundeservice, men den er blevet dårligere til generel viden, kodning og matematik fordi finjusteringen har overskrevet dele af den brede viden.
Domæneskift
Når en model trænet på ét domæne finjusteres på et andet:
Eksempel: En billedgenkendelsesmodel trænet til at klassificere dyr finjusteres til at klassificere biler. Efter finjustering kan den genkende bilmodeller men har glemt de fleste dyrearter.
Sekventiel læring
Systemer der skal lære kontinuerligt fra nye data over tid:
Eksempel: En spamfilter der løbende opdateres med nye typer spam. Hver opdatering forbedrer filtreringen af ny spam men kan gøre filteret dårligere til at fange ældre spamtyper der stadig cirkulerer.
Multilingval træning
Sprogmodeller der trænes sekventielt på flere sprog:
Eksempel: En model trænes først på engelsk, derefter på dansk. Hvis den danske træning er for aggressiv, kan modellen glemme dele af sin engelske kapabilitet. Den bliver bedre til dansk på bekostning af engelsk.
Graden af forgetting
Catastrophic forgetting er ikke binært. Det er et spektrum:
| Grad | Beskrivelse | Eksempel |
|---|---|---|
| Minimal | Lille tab af gammel viden | Finjustering med lav learning rate og få steps |
| Moderat | Mærkbart tab på specifikke opgaver | Intensiv finjustering på nyt domæne |
| Svær | Omfattende tab af tidligere kapabiliteter | Langvarig træning på fundamentalt anderledes data |
| Katastrofal | Næsten total tab af gammel viden | Aggressiv omlæring uden beskyttelse |
Graden afhænger af: hvor meget ny træning der udføres, hvor forskellig den nye opgave er fra den gamle, learning rate, og om der bruges modforanstaltninger.
Løsninger og modforanstaltninger
Regulariseringsbaserede metoder
Elastic Weight Consolidation (EWC): Identificerer hvilke vægte der er vigtigst for tidligere opgaver og begrænser hvor meget de kan ændres under ny træning. Vægte der er kritiske for gammel viden “låses” delvist.
L2-regularisering: Tilføjer en straf for at ændre vægte for meget fra deres oprindelige værdier. Simpelt men effektivt til at bremse forgetting.
Progressive Neural Networks: Tilføjer nye netværksmoduler for nye opgaver i stedet for at genbruge eksisterende. Gammel viden bevares intakt, men netværket vokser med hver ny opgave.
Replay-baserede metoder
Experience Replay: Gemmer eksempler fra tidligere opgaver og blander dem ind i træningen på nye opgaver. Netværket ser løbende gammel data og glemmer den derfor ikke.
Generative Replay: I stedet for at gemme faktisk gammel data, bruges en generativ model til at producere syntetiske eksempler der ligner gammel data. Kræver mindre lager men introducerer approximationsfejl.
Arkitekturbaserede metoder
Modulære netværk: Forskellige dele af netværket allokeres til forskellige opgaver. Ny læring påvirker kun det relevante modul, ikke hele netværket.
Dynamisk netværksekspansion: Netværket udvides automatisk med nye parametre når nye opgaver kræver det, i stedet for at genbruge eksisterende parametre.
Praktiske tilgange for LLM-finjustering
LoRA og PEFT: Parameter-effektive finjusteringsmetoder tilføjer et lille antal nye parametre i stedet for at ændre de originale vægte. De originale vægte forbliver uændrede, og forgetting minimeres dramatisk.
Lav learning rate: Brug en meget lav learning rate under finjustering for at begrænse hvor meget vægtene ændres.
Data mixing: Blanding af den nye opgaves data med en andel generelle data under finjustering. Modellen ser stadig bred data og glemmer derfor mindre.
Kort finjustering: Træn i få epochs i stedet for mange. Jo længere finjustering, jo mere forgetting.
Catastrophic forgetting vs. relaterede fænomener
| Fænomen | Beskrivelse | Nøgleforskel |
|---|---|---|
| Catastrophic forgetting | Glemmer gammel viden ved ny træning | Intern vægtoverskrivning |
| Model collapse | Kvalitetstab over generationer af AI-på-AI-træning | Rekursivt, fra syntetisk data |
| Overfitting | Memorerer træningsdata, generaliserer dårligt | Mister generaliseringsevne, ikke specifik gammel viden |
| Underfitting | Lærer ikke nok fra data | Aldrig lært i første omgang |
| Concept drift | Data ændrer sig over tid i produktionen | Ydre ændring, ikke intern forgetting |
Catastrophic forgetting i AI-industrien
Betydning for foundation models
Foundation models som GPT og Claude trænes først bredt (pre-training) og finjusteres derefter (RLHF, instruktions-finjustering). Denne finjustering skal balancere forbedret instruktionsfølgning med bevarelse af den brede viden fra pre-training. Catastrophic forgetting er en aktiv risiko i denne proces.
Continual learning som forskningsfelt
Forskning i continual learning (AI-systemer der kan lære kontinuerligt uden at glemme) er direkte motiveret af catastrophic forgetting. Det er et af de mest aktive forskningsfelter i maskinlæring og anses for afgørende for at bygge AI-systemer der kan tilpasse sig over tid.
Praktisk konsekvens for virksomheder
Virksomheder der finjusterer sprogmodeller til specifikke opgaver skal være opmærksomme på catastrophic forgetting:
- Test bredt efter finjustering: Tjek ikke kun performance på den nye opgave men også på generelle kapabiliteter
- Brug LoRA/PEFT: Parameter-effektive metoder minimerer forgetting markant
- Bevar en baseline: Sammenlign altid med den ufinjusterede model for at kvantificere tab
- Overvej data mixing: Blanding af opgavespecifik og generel data reducerer forgetting
Ofte stillede spørgsmål
Hvad er catastrophic forgetting?
Catastrophic forgetting er et fænomen hvor neurale netværk glemmer tidligere lært viden når de trænes på nye opgaver eller data. Det sker fordi ny træning opdaterer de vægte i netværket der indeholdt gammel viden, og de nye opdateringer overskriver de gamle mønstre. Det er en fundamental forskel fra menneskelig læring. Mennesker kan lære nye færdigheder uden at glemme gamle, mens neurale netværk i langt højere grad mister eksisterende kapabiliteter ved ny læring.
Hvordan påvirker catastrophic forgetting finjustering af AI-modeller?
Når en stor sprogmodel finjusteres på en specifik opgave (f.eks. kundeservice, juridisk analyse, medicinsk rådgivning), kan den miste generelle kapabiliteter som bred viden, matematisk ræsonnering eller kodning. Jo mere intensiv finjusteringen er, jo større er risikoen. Praktiske modforanstaltninger inkluderer brug af LoRA/PEFT (parameter-effektive metoder), lav learning rate, kort finjustering, og data mixing hvor generelle data blandes ind i den opgavespecifikke træning.
Kan catastrophic forgetting undgås helt?
Ikke fuldstændigt med nuværende teknologi, men det kan reduceres markant. De mest effektive metoder er parameter-effektiv finjustering (LoRA, QLoRA, PEFT) der kun ændrer en lille del af modellens vægte, regulariseringsteknikker som Elastic Weight Consolidation der beskytter vigtige vægte, og replay-metoder der blander gammel data ind i ny træning. Forskning i continual learning arbejder mod AI-systemer der kan lære kontinuerligt uden forgetting. Det er stadig et uløst problem.
Hvad er forskellen på catastrophic forgetting og model collapse?
Catastrophic forgetting sker inden for én model når ny træning overskriver gammel viden. Det er et internt fænomen der skyldes vægtoverskrivning. Model collapse sker over generationer af modeller der trænes på hinandens output. Det er et rekursivt fænomen der skyldes akkumuleret tab af diversitet i syntetiske data. Begge resulterer i tab af kapabilitet, men mekanismerne og konteksterne er fundamentalt forskellige.