AI Ordbog
Diffusion model
AI-modeller der genererer billeder ved gradvist at fjerne støj.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er en diffusion model?
En diffusion model er en type generativ AI der skaber billeder (og i stigende grad lyd og video) ved gradvist at fjerne støj fra tilfældig data. Det er teknologien bag Midjourney, DALL-E, Stable Diffusion og Flux.
Idéen er overraskende elegant: tag et billede, tilføj gradvist støj indtil det er ren statisk, og træn derefter et neuralt netværk til at reversere processen. At genskabe billedet fra støj. Når modellen har lært dette, kan den starte fra ren tilfældig støj og “denoize” den til et helt nyt billede der aldrig har eksisteret.
Navnet “diffusion” refererer til den fysiske proces diffusion, hvor partikler spreder sig fra høj koncentration til lav. Ligesom en dråbe blæk der opløses i vand. I modellen “diffunderer” information i billedet væk som støj tilføjes, og modellen lærer at samle den igen.
Diffusion models overtog tronen fra GAN’er (Generative Adversarial Networks) omkring 2021-2022 som den foretrukne teknik til billedgenerering, primært fordi de producerer billeder af højere kvalitet og er mere stabile at træne.
Hvordan fungerer diffusion models?
Processen har to faser:
- Forward-processen (tilføj støj). Under træning tager modellen et rigtigt billede og tilføjer gradvist gaussisk støj i mange små trin (typisk 1000). Hvert trin ødelægger billedet en lille smule. Efter alle trin er billedet ren tilfældig støj uden nogen synlig struktur.
- Reverse-processen (fjern støj). Modellen trænes til at forudsige og fjerne den støj der blev tilføjet i hvert trin. Den lærer at gå fra ren støj tilbage til et klart billede, ét trin ad gangen. Det er denne reverse-proces der bruges til at generere nye billeder.
Når du beder Midjourney om at lave “en kat der sidder på månen”, sker følgende: modellen starter med ren tilfældig støj og fjerner gradvist støj, styret af din tekstbeskrivelse, indtil et billede af en kat på månen tager form. Tekstbeskrivelsen fungerer som en guide der fortæller modellen hvilken retning den skal denoize i.
Nøglekomponenter
- U-Net. Det neurale netværk der udfører selve denoizingen. Det får et støjfyldt billede og forudsiger den støj der skal fjernes. Navnet U-Net kommer fra dets U-formede arkitektur.
- Text encoder. Konverterer din tekstprompt til en matematisk repræsentation modellen kan forstå. De fleste diffusion models bruger CLIP (fra OpenAI) som text encoder.
- Latent space. Mange moderne diffusion models (som Stable Diffusion) arbejder i et komprimeret “latent” rum i stedet for direkte med pixels. Det gør beregningerne langt hurtigere og kræver mindre hukommelse, men producerer stadig billeder i høj opløsning.
- Scheduler. Styrer tempoet for denoizingsprocessen: hvor mange trin der bruges, og hvor meget støj der fjernes per trin. Forskellige schedulers giver forskellige resultater.
De vigtigste diffusion models
- Midjourney. Den mest populære billedgeneringsmodel. Kendt for kunstnerisk kvalitet og æstetisk output. Closed source, tilgængelig via web og mobilapp.
- DALL-E / GPT-4o (OpenAI). Billedgenerering integreret i ChatGPT via GPT-4o (erstattede DALL-E 3 i 2025). Stærk til at følge detaljerede tekstbeskrivelser og generere tekst i billeder. Closed source.
- Stable Diffusion (Stability AI). Open source-alternativ der kan køres lokalt. Har et stort community der laver udvidelser, fine-tuned modeller og specialiserede versioner.
- Flux (Black Forest Labs). Nyere open source-model med høj kvalitet. Grundlagt af flere af de originale Stable Diffusion-forskere.
- Imagen (Google). Googles billedgenereringsmodel med fokus på fotorealisme og tekstforståelse.
Diffusion models i praksis
- Kunst og design. Konceptkunst, illustrationer, logoer og visuel brainstorming. Designere bruger diffusion models til hurtig prototyping og idéudvikling.
- Marketing. Produktbilleder, sociale medier-grafik og reklamevisualer. Virksomheder kan generere hundredvis af variationer på sekunder.
- Arkitektur. Visualisering af bygningskoncepter, interiørdesign og landskabsplanlægning fra tekstbeskrivelser.
- Mode. Generering af tøjdesigns, mønstervariationer og lookbook-billeder. Modeller kan vise tøj på forskellige kropstyper og i forskellige miljøer.
- Videogenerering. Sora (OpenAI), Runway, Kling og Veo (Google) bruger diffusion-baserede teknikker til at generere video. En naturlig forlængelse af billedgenerering til den tidsmæssige dimension.
Diffusion vs. GAN GAN’er (Generative Adversarial Networks) var den dominerende billedgenereringsteknik fra 2014-2021. De bruger to netværk der konkurrerer: en generator og en diskriminator. Diffusion models overtog fordi de producerer mere diverse og højere-kvalitets billeder, er mere stabile at træne (GAN’er er berygtet svære at træne), og er bedre til at følge tekstinstruktioner. GAN’er bruges stadig i visse nicheapplikationer, men diffusion models er nu standarden.
Begrænsninger
- Hastighed. Diffusion models kræver mange trin for at generere et billede (typisk 20-50 trin), hvilket gør dem langsommere end GAN’er. Forskning i “few-step” diffusion reducerer dette, men det er stadig en udfordring.
- Hænder og tekst. Diffusion models har historisk haft problemer med at generere realistiske hænder og læsbar tekst i billeder, selvom nyere modeller har forbedret dette markant.
- Konsistens. Det er svært at generere den samme karakter eller objekt konsekvent på tværs af flere billeder. Hvert billede er et nyt tilfældigt udgangspunkt.
- Copyright og etik. Modellerne er trænet på billeder skabt af mennesker, og spørgsmålet om copyright og kompensation til kunstnere er stadig uafklaret og juridisk omstridt.
FAQ
Hvad er en diffusion model?
En diffusion model er en type generativ AI der skaber billeder ved gradvist at fjerne støj fra tilfældig data. Den lærer at vende en støj-tilføjelsesproces om og kan dermed generere nye, originale billeder fra ren tilfældighed, styret af tekstbeskrivelser. Midjourney, DALL-E og Stable Diffusion er alle diffusion models.
Hvordan genererer diffusion models billeder fra tekst?
Modellen starter med ren tilfældig støj og fjerner gradvist støjen over mange trin. Din tekstprompt konverteres til en matematisk repræsentation der guider denoizingsprocessen, så det endelige billede matcher din beskrivelse. Det er som en skulptør der gradvist hugger en form ud af en marmorblok. Teksten er tegningen, støjen er marmoren.
Hvad er forskellen på Midjourney og Stable Diffusion?
Midjourney er closed source, kun tilgængelig online, og fokuserer på æstetisk, kunstnerisk kvalitet. Stable Diffusion er open source, kan køres lokalt på din egen computer, og har et stort community der laver udvidelser og fine-tuned versioner. Midjourney er typisk nemmere at bruge, mens Stable Diffusion giver mere kontrol.
Kan diffusion models generere video?
Ja. Sora (OpenAI), Runway, Kling og Veo (Google) bruger alle diffusion-baserede teknikker til videogenerering. Kvaliteten er forbedret markant og nærmer sig professionelt niveau for kortere sekvenser.