Spring til indhold
AI Ordbog

AI Ordbog

GAN (Generative Adversarial Network)

To neurale netværk der konkurrerer for at generere realistiske data.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er en GAN?

En GAN (Generative Adversarial Network) er en AI-arkitektur bestående af to neurale netværk der konkurrerer mod hinanden: en generator der skaber falske data, og en diskriminator der forsøger at skelne mellem ægte og falsk. Gennem denne konkurrence bliver generatoren bedre og bedre til at producere realistisk data.

Tænk på det som en falskmøntner og en politibetjent. Falskmøntneren (generatoren) prøver at lave falske pengesedler. Politibetjenten (diskriminatoren) prøver at fange de falske sedler. Over tid bliver falskmøntneren så god at selv politibetjenten ikke kan se forskel. Og det er det tidspunkt hvor GAN’en producerer virkelig overbevisende output.

GAN’er blev introduceret af Ian Goodfellow i 2014 og var et af de første store gennembrud inden for generativ AI. Yann LeCun, en af deep learnings grundlæggere, kaldte GAN’er “den mest interessante idé inden for maskinlæring i de seneste 10 år”. GAN’er var den dominerende teknik til billedgenerering indtil diffusion models overtog omkring 2021-2022.

Hvordan fungerer en GAN?

Træningsprocessen er en form for nulsumsspil:

  1. Generatoren starter med tilfældig støj og forsøger at generere data (typisk billeder) der ligner ægte data. I starten er outputtet ren statisk.
  2. Diskriminatoren modtager både ægte billeder fra træningsdataene og falske billeder fra generatoren. Den skal afgøre hvilke der er ægte og hvilke der er falske.
  3. Træningsloop. Begge netværk forbedres skiftevis:
    • Diskriminatoren trænes til bedre at skelne ægte fra falsk.
    • Generatoren trænes til bedre at snyde diskriminatoren.
  4. Ligevægt. Ideelt når træningen et punkt hvor generatoren producerer data der er umulig at skelne fra ægte data, og diskriminatoren ikke kan gøre det bedre end at gætte tilfældigt (50/50).

Det geniale ved GAN-arkitekturen er at generatoren aldrig ser de ægte data direkte. Den lærer udelukkende fra diskriminatorens feedback. Den lærer at generere realistiske billeder ved at lære hvad der narrer diskriminatoren.

Typer af GAN’er

Siden den originale GAN i 2014 er hundredvis af varianter blevet udviklet:

  1. DCGAN (Deep Convolutional GAN). Den første GAN der brugte convolutional netværk og demonstrerede at GAN’er kunne generere realistiske billeder. Et tidligt gennembrud i 2015.
  2. StyleGAN (NVIDIA). Producerer fotorealistiske ansigter i høj opløsning. Siden der genererer “denne person eksisterer ikke” (thispersondoesnotexist.com) brugte StyleGAN. Kendt for høj billedkvalitet.
  3. CycleGAN. Kan oversætte mellem billeddomæner uden parrede eksempler, f.eks. konvertere fotos til malerier i Monets stil, eller heste til zebraer.
  4. Pix2Pix. Oversætter billeder fra ét domæne til et andet med parrede eksempler, f.eks. skitser til fotorealistiske billeder eller dagbilleder til natbilleder.
  5. ProGAN. Træner progressivt. Starter med lave opløsninger og øger gradvist. Det gav markant bedre stabilitet og billedkvalitet.

GAN’er i praksis

  1. Ansigts-generering. StyleGAN kan generere fotorealistiske ansigter af personer der ikke eksisterer. Bruges i stock-foto, privacy-beskyttelse (erstatte rigtige ansigter) og underholdning.
  2. Image-to-image translation. Konvertering af skitser til billeder, dag til nat, vinter til sommer. Bruges i arkitektur, film og design.
  3. Super-resolution. Forbedring af billedopløsning. Gør et sløret, lavopløseligt billede skarpere og mere detaljeret. Bruges i satellit-billeder, medicinsk billedbehandling og foto-restaurering.
  4. Data augmentation. Generering af syntetiske træningsdata til andre AI-modeller. Hvis du mangler billeder af sjældne sygdomme, kan en GAN generere realistiske eksempler.
  5. Deepfakes. GAN-teknologi ligger bag mange deepfakes: overbevisende falske billeder og videoer af rigtige personer. Det er GAN’ernes mest kontroversielle anvendelse.

GAN’er vs. diffusion models

GAN’er var konger af billedgenerering fra 2014-2021. Så overtog diffusion models:

  1. Kvalitet. Diffusion models producerer generelt mere diverse og detaljerede billeder.
  2. Stabilitet. GAN-træning er berygtet ustabil. Modellen kan “kollapse” (mode collapse) og kun generere en håndfuld variationer. Diffusion models er mere stabile at træne.
  3. Tekststyring. Diffusion models er markant bedre til at følge tekstbeskrivelser. GAN’er var primært gode til uvilkårlig generering eller simple klasse-betingelser.
  4. Hastighed. Her vinder GAN’er. De genererer billeder i ét forward pass, mens diffusion models kræver mange trin. Det gør GAN’er hurtigere til inference.

Mode collapse Det mest berygtede problem med GAN’er er mode collapse: generatoren finder én type output der narrer diskriminatoren og producerer derefter kun variationer af det. Ligesom en falskmøntner der kun laver 100-kronesedler fordi de altid slipper igennem. I stedet for at lære at lave alle seddeltyper. Det fører til lav diversitet i det genererede output og var en af grundene til at diffusion models overtog.

GAN’ernes arv

Selvom diffusion models nu dominerer billedgenerering, var GAN’er afgørende:

  1. Beviste konceptet. GAN’er demonstrerede for første gang at AI kunne generere fotorealistisk visuelt indhold. Noget der syntes umuligt før 2014.
  2. Adversarial training. Idéen om at lade to modeller konkurrere er blevet anvendt bredt i AI, herunder i AI-sikkerhed (adversarial robustness).
  3. Stadig relevante. GAN’er bruges stadig i nicheapplikationer hvor hastighed er kritisk, og forskning i GAN-teknikker fortsætter.

FAQ

Hvad er en GAN?

En GAN (Generative Adversarial Network) er en AI-arkitektur med to neurale netværk der konkurrerer: en generator der laver falske data og en diskriminator der forsøger at fange de falske. Gennem denne konkurrence lærer generatoren at producere ekstremt realistiske billeder, lyd eller andre data.

Hvad er forskellen på en GAN og en diffusion model?

GAN'er bruger to konkurrerende netværk og genererer billeder i ét trin (hurtigt). Diffusion models fjerner gradvist støj over mange trin (langsommere, men højere kvalitet). Diffusion models er bedre til at følge tekstinstruktioner og mere stabile at træne. GAN'er var dominerende 2014-2021, diffusion models har overtaget siden.

Hvad er deepfakes?

Deepfakes er realistiske falske billeder eller videoer skabt med AI. Ofte ved brug af GAN-teknologi. De kan vise personer der siger eller gør ting der aldrig er sket. Deepfakes rejser alvorlige etiske og juridiske spørgsmål om misinformation, samtykke og identitetstyveri.

Bruges GAN'er stadig?

Ja, men i mindre grad end før. GAN'er bruges stadig i super-resolution (billedforbedring), data augmentation, real-time billedgenerering og visse specialiserede applikationer. Diffusion models har dog overtaget som den foretrukne teknik til de fleste billedgenereringsopgaver.


Relaterede termer