Spring til indhold
AI Ordbog

AI Ordbog

Text-to-image

AI-teknologi der genererer billeder ud fra tekstbeskrivelser.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er text-to-image?

Text-to-image er AI der skaber billeder ud fra ord. Du skriver en tekstbeskrivelse, en prompt. AI’en genererer et billede der matcher beskrivelsen. “En kat der sidder på en måne i akvarelstil” → et færdigt billede på sekunder.

Det er en af de mest synlige og forbløffende anvendelser af generativ AI. Før 2022 krævede billedskabelse enten kunstnerisk talent, professionel software eller et fotoapparat. I dag kan enhver beskrive et billede i ord og få det genereret øjeblikkeligt.

Teknologien har udviklet sig eksplosivt. De tidlige modeller producerede slørede, usammenhængende billeder. Moderne modeller som DALL-E 3, Midjourney v7 og Flux.2 genererer billeder der kan være svære at skelne fra fotografier eller professionelle illustrationer.

Hvordan fungerer text-to-image?

Det overordnede flow

  1. Prompt. Brugeren skriver en tekstbeskrivelse: “Et fotorealistisk billede af en gammel fiskerbåd i en norsk fjord ved solopgang.”
  2. Tekstforståelse. En sprogmodel (typisk CLIP eller T5) konverterer teksten til en numerisk repræsentation (en embedding) der fanger meningen.
  3. Billedgenerering. En generativ model (typisk en diffusionsmodel) skaber et billede der matcher tekst-embeddingens mening.
  4. Output. Et færdigt billede (typisk 1024×1024 pixels eller højere).

Diffusionsmodeller: den dominerende teknologi

De fleste moderne text-to-image modeller bruger diffusion:

  1. Træning. Modellen lærer at fjerne støj fra billeder. Den præsenteres for millioner af billeder der gradvist er tilsat støj, og lærer at genskabe det originale billede.
  2. Generering. Start med ren tilfældig støj. Fjern gradvist støj over mange trin (typisk 20-50) styret af tekst-prompten. Hvert trin bringer billedet tættere på et meningsfuldt resultat.
  3. Tekst-guidning. Ved hvert trin i processen bruges tekst-embeddingens information til at styre hvilken retning støj-fjernelsen tager. “Kat” trækker billedet mod katteagtige former, “akvarelstil” trækker mod vandfarvede teksturer.

Andre tilgange

GAN-baserede modeller Tidligere generation. En generator skaber billeder, en diskriminator vurderer dem. De to træner mod hinanden. Hurtigere end diffusion men typisk lavere kvalitet og diversitet.

Autoregressive modeller Genererer billedet som en sekvens af pixels eller patches, ligesom en sprogmodel genererer tekst token for token. Bruges af nogle nyere modeller.

Transformer-baserede modeller Kombinerer transformer-arkitektur med billedgenerering. Bruges i nyere modeller som Googles Imagen og Parti.

Text-to-image modeller og værktøjer

DALL-E (OpenAI)

  1. DALL-E 3. Integreret i ChatGPT. Forstår komplekse prompts, genererer tekst i billeder korrekt.
  2. Styrker. Nem at bruge, god prompt-forståelse, integreret i et velkendt interface.
  3. Brug. Direkte i ChatGPT (Plus/Team/Enterprise) eller via API.
  4. Begrænsninger. Strenge content policies. Genererer ikke offentlige personers ansigter.

Midjourney

  1. Version 7. Kendt for æstetisk kvalitet og kunstnerisk stil. Foretrukket af kreative professionelle.
  2. Styrker. Exceptionel visuel kvalitet. Stærk til kunstneriske, stemningsfulde billeder.
  3. Brug. Via web-interface på midjourney.com eller Discord.
  4. Begrænsninger. Mindre præcis prompt-følging end DALL-E 3. Discord-interfacet kan virke uintuitivt.

Stable Diffusion (Stability AI)

  1. Open source. Modellen kan downloades og køres lokalt. Fuld kontrol over alt.
  2. SDXL og SD 3.5. Nyere versioner med markant forbedret kvalitet.
  3. Styrker. Ubegrænset tilpasning. Ingen content restrictions (afhænger af lokal opsætning). Gratis at bruge lokalt.
  4. Brug. Lokalt via ComfyUI, Automatic1111 eller InvokeAI. Cloud via DreamStudio, Clipdrop.
  5. Økosystem. Tusindvis af community-trænede modeller, LoRAs og controlnets for specifikke stilarter og funktioner.

Adobe Firefly

  1. Integreret i Adobe. Direkte i Photoshop, Illustrator og Adobe Express.
  2. Styrker. Kommercielt sikkert: trænet på licenseret indhold. Integreret i professionelle workflows.
  3. Brug. Adobe-produkter og web. Inkluderet i Adobe-abonnementer.
  4. Begrænsninger. Generelt lavere kvalitet end Midjourney. Fokuseret på kommerciel sikkerhed.

Google Imagen

  1. Imagen 4. Googles nyeste billedmodel (lanceret maj 2025). Tilgængelig via Google AI Studio og Vertex AI.
  2. Styrker. God fotorealisme, tekst-rendering og op til 2K-opløsning.
  3. Brug. API, Google AI Studio og Google-produkter.

Flux (Black Forest Labs)

  1. Flux.2. Open source med kommercielle varianter. Lanceret november 2025.
  2. Styrker. Konkurrerer med Midjourney på kvalitet. Stærk prompt-adherence.
  3. Varianter. Flux.2 [klein] (hurtig), Flux.2 [dev] (kvalitet), Flux.2 [pro] (kommerciel).

Prompt engineering for billeder

At skrive gode prompts er afgørende for kvaliteten:

Grundlæggende promptstruktur

[Motiv] + [Detaljer] + [Stil] + [Tekniske parametre]

  1. Motiv. Hvad billedet viser: “En kvinde der læser en bog i en regnfuld have.”
  2. Detaljer. Specifikke elementer: “Rødt paraply, valmuer i baggrunden, eftermiddagslys.”
  3. Stil. Kunstnerisk retning: “I stil med impressionisme, bløde penselstrøg, pastelfarver.”
  4. Teknisk. Kameraspecifikationer: “85mm portrætobjektiv, f/1.4, bokeh-baggrund, 4K.”

Eksempler på prompts

Simpel prompt: “En hund på en strand” → Generisk resultat, AI vælger alle detaljer.

Detaljeret prompt: “En golden retriever der løber langs en tom sandstrand ved solnedgang, gyldent lys, lavt kameravinkel, skumsprøjt, fotorealistisk, 85mm objektiv, varme farver” → Specifikt, kontrolleret resultat.

Kunstnerisk prompt: “Portræt af en ung violinist, dramatisk sidelys, chiaroscuro, oliemaleri-stil inspireret af Rembrandt, mørk baggrund, varme hudtoner, detaljerede hænder” → Kunstnerisk, stemningsfuldt resultat.

Tips til bedre prompts

  1. Vær specifik. “En bygning” giver et generisk resultat. “Et art deco-kontorhøjhus i kobber og glas, set nedefra mod en blå himmel” giver noget konkret.
  2. Beskriv stil. Fotorealisme, akvarel, digital art, anime, minimalistisk, stil former resultatet fundamentalt.
  3. Angiv belysning. Lys er altafgørende: “Blød morgensol,” “dramatisk sidelys,” “neonbelysning.”
  4. Brug negative prompts. Mange modeller tillader at specificere hvad du ikke vil have: “Ingen tekst, ingen watermarks, ingen deformerede hænder.”

Anvendelser

Kreativt arbejde

  1. Konceptkunst. Game-designere og filmproducenter genererer hurtigt visuelle koncepter.
  2. Illustration. Blogindlæg, artikler og præsentationer med unikke illustrationer.
  3. Moodboards. Visualisér en idé eller stemning hurtigt før et fotoshoot eller en designproces.
  4. Eksperimentering. Kunstnere bruger AI som et kreativt værktøj til at udforske stilarter og idéer.

Marketing og forretning

  1. Social media. Unikke billeder til opslag i stedet for stockfotos.
  2. Produktvisualisering. Vis et produkt i forskellige miljøer, farver og kontekster uden fotoshoot.
  3. Annoncering. Generer hurtigt varianter af annoncebilleder til A/B-test.
  4. Prototyping. Visualisér en app, en butik eller et rumdesign før det bygges.

Produktudvikling

  1. Mockups. Generer visuelle prototyper af produkter, emballage og brugergrænseflader.
  2. Varianter. “Vis dette ur i 5 forskellige farvekombinationer” på sekunder.
  3. Storyboards. Visualisér brugerrejser, film-scener eller produkt-flows.

Uddannelse og kommunikation

  1. Undervisningsmateriale. Illustrér historiske begivenheder, videnskabelige koncepter, abstrakte idéer.
  2. Præsentationer. Unikke illustrationer der matcher dit budskab præcist.
  3. Tilgængelighed. Visualisér komplekse tekster for visuelt orienterede lærende.

Avancerede funktioner

Image-to-image

Transformér et eksisterende billede baseret på en prompt:

  1. Upload en skitse → AI genererer et færdigt billede.
  2. Upload et foto → AI ændrer stil, belysning eller elementer.
  3. Kontrolleret transformation: bevar komposition men ændr stil.

Inpainting

Redigér dele af et billede:

  1. Markér et område → beskriv hvad der skal erstatte det.
  2. “Erstat himlen med en dramatisk solnedgang.”
  3. “Fjern personen i baggrunden og udfyld med det omgivende landskab.”

Outpainting

Udvid et billedes rammer:

  1. AI genererer nyt indhold der fortsætter det eksisterende billede.
  2. Gør et portræt til et landskabsbillede ved at udvide siderne.
  3. Bevarer stil, belysning og kontekst fra det originale billede.

ControlNet

Styr billedets komposition præcist:

  1. Pose. Upload et billede med en persons positur → AI genererer et nyt billede med samme positur.
  2. Dybde. Upload et dybdekort → AI genererer et billede med samme rum-layout.
  3. Kanter. Upload en kantskitse → AI udfylder med realistisk indhold.
  4. Styrke. Kontrollér hvor strikt AI’en følger referencen.

Kvalitet og begrænsninger

Styrker

  1. Hastighed. Sekunder til minutter for et billede der ville tage timer for en kunstner.
  2. Variation. Generer 50 varianter af det samme koncept øjeblikkeligt.
  3. Tilgængelighed. Enhver kan skabe visuelt indhold. Ingen kunstnerisk træning påkrævet.
  4. Iteration. Justér prompten, generer igen, konverger mod det ønskede resultat.

Vedvarende udfordringer

  1. Hænder og fingre. Modeller har historisk haft problemer med anatomisk korrekte hænder. Forbedret markant i nyere modeller men stadig en svaghed.
  2. Tekst i billeder. Generering af korrekt tekst i billeder er svært. DALL-E 3 og Flux håndterer det bedre end ældre modeller.
  3. Konsistens. Svært at generere den samme karakter eller det samme objekt konsistent på tværs af flere billeder.
  4. Fysisk korrekthed. AI kan generere umulige scenarier: reflektioner der ikke stemmer, skygger der peger forkert, objekter der svæver.
  5. Fototeksturer. Fotorealistiske billeder har sommetider et “AI-look”: en overperfekt, plastisk kvalitet.

Etik og debat

Ophavsret og træninsdata

  1. Debatten. Text-to-image modeller er trænet på milliarder af billeder fra internettet. Mange ophavsretsbeskyttede. Kunstnere og fotografer har rejst retssager.
  2. Positioner. Kunstnere argumenterer for at modeller der er trænet på deres værker bør kreditere og kompensere dem. AI-virksomheder argumenterer for at træning er fair use.
  3. Udvikling. Adobe Firefly er trænet udelukkende på licenseret indhold. Shutterstock og Getty har partnerskaber med AI-virksomheder. Lovgivning er under udvikling.

Deepfakes og misinformation

  1. AI-genererede billeder kan bruges til at skabe falske beviser, misinformation og bedrageri.
  2. Modeller har typisk sikkerhedsforanstaltninger: DALL-E nægter at generere offentlige personers ansigter.
  3. Detektionsteknologi udvikles parallelt. Men det er et kapløb.

Impact på kreative erhverv

  1. Stockfoto-industrien er under pres. Hvorfor betale for et stockfoto når AI genererer et unikt alternativ?
  2. Illustratorer og konceptkunstnere oplever ændrede jobprofiler.
  3. Nye roller opstår: AI art director, prompt engineer, AI-assisteret billedredaktør.

Text-to-image i praksis

Eksempel: marketingteam

  1. Behov. 20 unikke billeder til en kampagne med 5 varianter af hvert motiv.
  2. Traditionelt. Fotoshoot (10.000+ kr.) eller stockfotos (begrænset tilpasning).
  3. Med AI. Skriv prompts, generer 100 varianter, vælg de bedste, redigér i Photoshop.
  4. Tid. 2 timer i stedet for 2 uger. Omkostning: AI-abonnement.

Eksempel: produktdesigner

  1. Behov. Visualisér 10 farvevarianter af en ny stol.
  2. Traditionelt. 3D-rendering (dage) eller prototyper (uger).
  3. Med AI. Image-to-image: upload ét billede af stolen → generer varianter med forskellige farver, materialer og miljøer.
  4. Brug. Hurtig intern beslutning. Ikke erstatning for den endelige 3D-rendering, men perfekt til tidlige designbeslutninger.

Eksempel: indie-spiludvikler

  1. Behov. Konceptkunst til 50 miljøer i et RPG-spil.
  2. Budget. Ikke råd til en konceptkunstner fuldtid.
  3. Med AI. Generer konceptbilleder med Midjourney, brug dem som udgangspunkt for den endelige pixelart.
  4. Resultat. Konceptfasen reduceret fra måneder til uger. AI som kreativ sparringspartner, ikke erstatning.

Text-to-image har demokratiseret billedskabelse Før AI krævede billedskabelse enten talent, uddannelse eller budget. Text-to-image har ændret det fundamentalt: enhver der kan beskrive et billede i ord kan nu skabe det. Det er en af de mest tilgængelige og umiddelbart imponerende former for AI. Og en af de mest debatterede. Teknologien rejser reelle spørgsmål om ophavsret, kreative erhverv og autenticitet. Men den skaber også reelle muligheder for alle der har brug for visuelle udtryk: fra marketingteamet der ikke har budget til et fotoshoot til læreren der vil illustrere et abstrakt koncept. Svaret er ikke at afvise eller omfavne ukritisk. Det handler om at forstå, bruge ansvarligt og forme den i en retning der skaber værdi.


FAQ

Hvad er text-to-image AI?

Text-to-image er AI-teknologi der genererer billeder baseret på tekstbeskrivelser (prompts). Du skriver f.eks. "En kat på en regnbue i akvarelstil," og AI'en skaber et tilsvarende billede på sekunder. De mest kendte værktøjer er DALL-E 3, Midjourney og Stable Diffusion. Teknologien er typisk baseret på diffusionsmodeller.

Hvilken text-to-image AI er bedst?

Det afhænger af behovet. Midjourney producerer den højeste æstetiske kvalitet og er foretrukket af kreative. DALL-E 3 er nemmest at bruge (integreret i ChatGPT) og bedst til præcis prompt-følging. Stable Diffusion er gratis og open source med ubegrænset tilpasning. Adobe Firefly er sikrest for kommerciel brug da den er trænet på licenseret indhold.

Er text-to-image billeder ophavsretsbeskyttede?

Det juridiske landskab er under udvikling. I de fleste jurisdiktioner kan AI-genererede billeder uden væsentlig menneskelig kreativ indsats ikke ophavsretbeskyttes. Men billedet kan frit bruges kommercielt af den der genererede det (afhængigt af platformens vilkår). Spørgsmålet om hvorvidt træninsdata krænker kunstneres ophavsret er genstand for igangværende retssager.

Hvordan skriver man gode text-to-image prompts?

Beskriv motivet specifikt, tilføj stilangivelse (fotorealistisk, akvarel, digital art), specificér belysning (blød morgensol, dramatisk sidelys) og tekniske detaljer (vidvinkel, bokeh, 4K). Jo mere specifik prompten er, desto bedre matcher resultatet din vision. Brug negative prompts til at udelukke uønskede elementer.


Relaterede termer