AI Ordbog
Model collapse
Et fænomen hvor AI-modeller trænet på data genereret af andre AI-modeller gradvist mister kvalitet, diversitet og nøjagtighed over generationer.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er model collapse?
Model collapse er et fænomen hvor AI-modeller der trænes på data genereret af andre AI-modeller gradvist mister kvalitet, diversitet og nøjagtighed. For hver generation af modeller der trænes på den foregående generations output, bliver data lidt mere gennemsnitlige, lidt mindre varierede og lidt mere fejlbehæftede, indtil modellens output kollapser til en snæver, repetitiv og ofte meningsløs delmængde af hvad den burde kunne producere.
Forestil dig at du fotokopier et dokument. Første kopi er næsten identisk med originalen. Men kopier du kopien, mister du lidt detalje. Kopierer du den kopi igen, mister du mere. Efter 20 generationer er teksten ulæselig og billederne er uigenkendelige klatter. Det samme sker med AI-modeller: hver generation af træning på AI-genereret data mister nuancer og diversitet.
Termen blev formaliseret i en indflydelsesrig forskningsartikel fra 2023 af Shumailov et al. fra University of Oxford og Cambridge, der matematisk beviste at model collapse er en uundgåelig konsekvens af rekursiv træning på modelgenereret data.
Hvorfor sker model collapse?
Det statistiske fundament
AI-modeller lærer at approximere fordelingen af deres træningsdata. Men ingen model er perfekt. Den fanger de mest fremtrædende mønstre men mister subtile detaljer og sjældne variationer. Når den næste model trænes på den første models output, lærer den en approximation af en approximation:
Virkeligheden: En rig, kompleks fordeling med uendelig variation
↓
Model 1 trænes på virkelige data → Fanger 95% af mønstrene, mister 5% af sjældne variationer
↓
Model 2 trænes på Model 1's output → Fanger 95% af Model 1's mønstre = 90% af virkeligheden
↓
Model 3 trænes på Model 2's output → Fanger 95% af Model 2's mønstre = 86% af virkeligheden
↓
...efter 10 generationer → Fanger måske 60% af virkeligheden
↓
...efter 50 generationer → Kollapset til en snæver, repetitiv delmængde
Hvert led i kæden taber information. De sjældne men vigtige datapunkter i halerne af fordelingen forsvinder først, de usædvanlige formuleringer, de overraskende perspektiver, de specialiserede fagtermer.
Forstærkningseffekten
Model collapse forstærkes af to mekanismer:
1. Tab af haler (tail collapse): Statistiske fordelinger har “haler”. Sjældne men reelle datapunkter. En models output overrepræsenterer midten af fordelingen og underrepræsenterer halerne. Næste generation ser endnu færre hale-eksempler og underrepræsenterer dem yderligere. Over tid forsvinder halerne helt, og modellen kan kun producere “gennemsnitligt” output.
2. Fejlakkumulering: Små fejl i én generation forstærkes i den næste. Hvis Model 1 har en svag tendens til at bruge ordet “innovativ” lidt for ofte, vil Model 2 se “innovativ” som endnu mere fremtrædende i sine træningsdata og bruge det endnu oftere. Model 3 forstærker tendensen yderligere. Over generationer dominerer bestemte ord og mønstre mens andre forsvinder.
Et konkret eksempel
Forestil dig en sprogmodel der trænes til at skrive produktbeskrivelser:
Generation 0 (ægte data): Stor variation i stil, ordvalg, længde og perspektiv. Nogle er tekniske, andre poetiske, nogle korte, andre detaljerede. Afspejler den fulde bredde af menneskelig skrivning.
Generation 1: God kvalitet, men lidt mindre variation. De mest usædvanlige formuleringer er sjældnere. Stilen er lidt mere homogen.
Generation 3: Mærkbart mere generisk. Bestemte fraser (“revolutionerende design”, “uovertruffen kvalitet”) optræder hyppigere. Unikke perspektiver er sjældne.
Generation 5: Repetitivt og forudsigeligt. De fleste beskrivelser lyder ens. Modellen har “glemt” at produktbeskrivelser kan være overraskende, humoristiske eller provokerende.
Generation 10: Kollapset. Modellen producerer næsten identiske beskrivelser uanset produktet. Ordforrådet er drastisk reduceret. Outputtet er meningsløst generisk.
Hvorfor er model collapse et problem nu?
Internettet fyldes med AI-indhold
Før 2023 var stort set alt indhold på internettet menneskeligt produceret. Fremtidige sprogmodeller kunne trygt trænes på internetdata og antage at det repræsenterede ægte menneskelig sprogbrug.
I dag producerer AI-modeller enorme mængder tekst, blogposts, produktbeskrivelser, nyhedsartikler, kommentarer, emails og kode. Estimater antyder at en markant andel af nyt online-indhold allerede er AI-genereret, og andelen vokser hurtigt.
Det betyder at fremtidige modeller der trænes på internetdata uundgåeligt vil træne på AI-genereret indhold fra tidligere modeller. Rekursionen er begyndt. Og med den risikoen for model collapse i stor skala.
Datakontaminering
Selv med de bedste filtre er det ekstremt svært at skelne høj-kvalitets AI-genereret tekst fra menneskeligt produceret tekst. Filtrering af AI-indhold fra træningsdata er et uløst problem. Det betyder at model collapse ikke bare er en teoretisk risiko men en praktisk udfordring for alle der træner store sprogmodeller.
Typer af model collapse
Tidlig model collapse
De første tegn: modellens output bliver gradvist mere homogent. Variationen i ordvalg, sætningsstruktur og perspektiv falder. Outputtet er stadig korrekt og brugbart men mærkbart mere generisk end output fra modeller trænet på ægte data.
Sen model collapse
Avanceret stadie: modellen producerer repetitivt, cirkulært eller meningsløst output. Den kan sidde fast i loops, generere den samme sætning med minimale variationer, eller producere tekst der er grammatisk korrekt men indholdsløs.
Funktionel collapse
Modellen mister evnen til at håndtere specifikke opgaver eller domæner. Den kan stadig producere generel tekst men har “glemt” specialiseret viden, sjældne sprog eller nichedomæner der var underrepræsenteret i de AI-genererede træningsdata.
Model collapse i praksis
Billedgenerering
Model collapse er observeret i billedgenereringsmodeller. Hvis en diffusion-model trænes på billeder genereret af en tidligere diffusion-model, degraderer kvaliteten:
- Generation 1: Fotorealistiske, varierede billeder
- Generation 3: Stadig realistiske men med mere ensartet stil og farvepalette
- Generation 5: Tydelig kvalitetsnedgang, artefakter, reduceret variation
- Generation 10: Slørede, monotone billeder med gentagne mønstre
Tekstgenerering
Forskere har demonstreret model collapse i sprogmodeller ved at gentagne gange finjustere modeller på forgængerens output:
- Ordforrådet skrumper for hver generation
- Sætningsstrukturer bliver mere ensartede
- Faktuel viden degraderer. Modellen “glemmer” korrekte fakta
- Kreativiteten falder markant
Oversættelse
Oversættelsesmodeller der trænes på maskinoversatte tekster (i stedet for menneskeligt oversatte) viser model collapse via “translationese”: outputtet bliver gradvist mere stift, unaturligt og præget af kildesprogents struktur.
Modforanstaltninger
Bevar ægte data
Den vigtigste modforanstaltning: sørg for at træningsdata indeholder en markant andel ægte, menneskeligt produceret data. Selv en lille mængde ægte data i hvert træningsrun kan modvirke model collapse ved at “genforankre” modellen i virkelige mønstre.
Datakuratering og filtrering
Investér i systemer der kan identificere og filtrere AI-genereret indhold fra træningsdata. Det er teknisk svært men afgørende. Metoder inkluderer:
- Statistisk detektion af AI-genereret tekst
- Metadata-baseret filtrering (timestamps, kilder)
- Kvalitetsfiltre der fjerner generisk, repetitivt indhold
- Perplexity-baseret filtrering (AI-tekst har ofte lavere perplexity)
Diversitetsbevarelse
Aktive teknikker til at bevare diversitet i træningsdata:
- Oversampling af sjældne domæner, sprog og stilarter
- Data augmentation der introducerer variation
- Diversity-aware sampling der sikrer bred repræsentation
Watermarking
AI-genereret indhold kan mærkes med usynlige vandmærker der gør det muligt at identificere det som AI-genereret. Hvis alle AI-udbydere implementerer watermarking, kan AI-indhold filtreres fra fremtidige træningsdata. OpenAI, Google og Anthropic arbejder på watermarking-teknikker.
Frisk datapipeline
Kontinuerlig indsamling af friske, menneskeligt producerede data fra verificerede kilder: akademiske publikationer, professionelt redigerede medier, curated datasæt med bekræftet menneskelig oprindelse.
Regulariseringsteknikker
Tekniske tilgange under træning der modvirker collapse:
- Tidlig stopning (early stopping) før modellen overtilpasser til gennemsnittet
- Noise injection der tvinger modellen til at bevare robusthed
- Ensemble-metoder der kombinerer flere modeller for at bevare diversitet
Model collapse vs. relaterede problemer
| Problem | Beskrivelse | Forskel fra model collapse |
|---|---|---|
| Model collapse | Kvalitetstab over generationer af AI-på-AI-træning | Rekursivt, akkumulerende over tid |
| Overfitting | Model der memorerer træningsdata i stedet for at generalisere | Sker inden for én træningscyklus |
| Mode collapse (GAN) | GAN-generator der kun producerer få variationer | Specifikt for GAN-arkitekturen |
| Catastrophic forgetting | Model der glemmer gammel viden når den lærer nyt | Sker under finjustering, ikke rekursion |
| Data drift | Træningsdata afspejler ikke længere virkeligheden | Ydre ændring, ikke selvforstærkende |
Implikationer for AI-industrien
“Peak data”-hypotesen
Nogle forskere argumenterer for at vi nærmer os “peak data”: det punkt hvor mængden af ægte, menneskeligt produceret data af høj kvalitet på internettet er udtømt. Fremtidige modeller vil uundgåeligt træne på delvist AI-genereret data, hvilket gør model collapse til en strukturel udfordring for industrien.
Værdien af ægte data stiger
Efterhånden som model collapse bliver en reel trussel, stiger værdien af verificeret, menneskeligt produceret data. Datasæt med garanteret menneskelig oprindelse (f.eks. fra forlag, medievirksomheder, akademiske institutioner) bliver et strategisk aktiv.
Regulering og standarder
Model collapse styrker argumentet for regulering af AI-genereret indhold. Mærkning af AI-indhold, krav om watermarking og transparency-standarder kan hjælpe med at identificere og filtrere AI-genereret data fra træningspipelines.
Ofte stillede spørgsmål
Hvad er model collapse?
Model collapse er et fænomen hvor AI-modeller der trænes på data genereret af andre AI-modeller gradvist mister kvalitet, diversitet og nøjagtighed over generationer. Ligesom en fotokopi af en fotokopi bliver mere og mere utydelig, degraderer AI-modellernes output når de trænes rekursivt på hinandens output. Sjældne men vigtige mønstre forsvinder først, outputtet bliver stadig mere generisk og repetitivt, og til sidst kollapser modellen til en snæver delmængde af hvad den burde kunne producere.
Hvorfor er model collapse et problem nu?
Fordi internettet i stigende grad fyldes med AI-genereret indhold. Før 2023 var stort set alt online-indhold menneskeligt produceret, og AI-modeller kunne trygt trænes på det. I dag producerer AI enorme mængder tekst, billeder og kode, og det er svært at skelne det fra menneskeligt produceret indhold. Fremtidige modeller der trænes på internetdata vil uundgåeligt inkludere AI-genereret data, hvilket starter den rekursive loop der fører til model collapse.
Kan model collapse forhindres?
Det kan modvirkes men sandsynligvis ikke fuldstændigt forhindres. De vigtigste modforanstaltninger er: (1) Bevare og prioritere ægte, menneskeligt produceret data i træningspipelines. (2) Filtrere AI-genereret indhold fra træningsdata via detektion og watermarking. (3) Aktiv diversitetsbevarelse i datasæt. (4) Regulariseringsteknikker under træning. Selv en relativt lille andel ægte data i hvert træningsrun kan markant modvirke collapse-effekten.
Påvirker model collapse alle AI-modeller?
Model collapse påvirker modeller der trænes på AI-genereret data, uanset om det er sprogmodeller, billedmodeller eller andre typer. Effekten er stærkest for modeller der udelukkende trænes på AI-genereret data og svagere for modeller der primært trænes på ægte data med kun en mindre andel AI-genereret indhold. Modeller der aldrig trænes på AI-genereret data er ikke direkte påvirket, men det bliver stadigt sværere at garantere at et stort datasæt er frit for AI-indhold.