Spring til indhold
AI Ordbog

AI Ordbog

Text-to-video

AI-teknologi der genererer videoklip ud fra tekstbeskrivelser.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er text-to-video?

Text-to-video er AI der skaber videoklip ud fra ord. Du skriver en tekstbeskrivelse (“En drone flyver hen over en tropisk ø ved solnedgang”) og AI’en genererer et videoklip med bevægelse, belysning, kamerabevægelse og realistisk fysik.

Det er en naturlig evolution af text-to-image. Hvor text-to-image genererer ét stillbillede, genererer text-to-video en sekvens af billeder der tilsammen danner en sammenhængende video (typisk 4-25 sekunder lang).

Teknologien er nyere og mindre moden end text-to-image. De første overbevisende resultater kom i 2023-2024, og kvaliteten forbedres hurtigt. Men vi er stadig i den tidlige fase: videoerne er korte, kan have artefakter, og fuld kreativ kontrol er begrænset sammenlignet med traditionel videoproduktion.

Hvordan fungerer text-to-video?

Den grundlæggende udfordring

Video er fundamentalt sværere end billeder:

  1. Temporal konsistens. Hvert frame skal være konsistent med det forrige. Et ansigt skal ligne sig selv fra frame til frame. En bold der kastes op skal falde ned igen.
  2. Bevægelse. AI’en skal forstå hvordan ting bevæger sig: vand flyder, hår vajer i vinden, mennesker går med naturlige bevægelser.
  3. Fysik. Objekter skal opføre sig fysisk korrekt: tyngdekraft, reflektioner, skygger der ændrer sig med bevægelse.
  4. Datamængde. En 10-sekunders video i 30 fps er 300 frames. Det er 300 billeder der alle skal være konsistente og sammenhængende.

Diffusionsmodeller til video

De fleste text-to-video modeller udvider diffusionsmodeller fra billeder til video:

  1. 3D diffusion. I stedet for at generere ét billede (2D: bredde × højde) genererer modellen en videokubus (3D: bredde × højde × tid).
  2. Temporal attention. Modellen lærer sammenhænge på tværs af frames: “hvis bolden er her i frame 1, bør den være der i frame 2.”
  3. Tekst-guidning. Promptens embedding styrer hele videoen: motiv, stil, bevægelse, stemning.
  4. Progressive generering. Start med grov opløsning og lav framerate. Forbedr gradvist til fuld kvalitet.

Latent space video generation

For at reducere den enorme beregningsbyrde:

  1. Encode. Komprimer hvert frame til en kompakt repræsentation (latent space) via en autoencoder.
  2. Generer. Kør diffusionsprocessen i det komprimerede rum, langt hurtigere end pixel-space.
  3. Decode. Konverter den genererede latente repræsentation tilbage til en video i fuld opløsning.

Text-to-video modeller og værktøjer

Sora 2 (OpenAI)

  1. Kapabilitet. Op til 25 sekunders video i op til 1080p. Realistisk fysik, komplekse scener, kamerabevægelser. Genererer video og lyd synkront.
  2. Styrker. Stærk fotorealisme. Forstår komplekse prompts med flere elementer og handlinger. Extensions gør det muligt at forlænge videoer.
  3. Brug. Tilgængelig for ChatGPT Plus/Pro-abonnenter.
  4. Begrænsninger. Kan stadig producere artefakter: hænder, fysiske interaktioner mellem objekter, lange sammenhængende handlinger.

Runway Gen-4.5

  1. Pioneer. Runway var blandt de første med kommercielt tilgængelige text-to-video værktøjer.
  2. Gen-4.5. Topper Artificial Analysis Text to Video benchmark. Stærk på bevægelseskvalitet, prompt-adherence og visuel kvalitet.
  3. Styrker. Godt interface, tilgængeligt for kreative professionelle. Tilbyder også image-to-video og video-to-video.
  4. Brug. Web-platform med abonnement. API tilgængelig.

Kling 3.0 (Kuaishou)

  1. Kinesisk model. Lanceret februar 2026. Konkurrerer med Sora og Runway på kvalitet.
  2. Styrker. Multi-shot storyboarding, op til 4K/60fps, 15 sekunder per klip. Genererer synkroniseret lyd.
  3. Brug. Web-platform. Tilgængelig internationalt.

Pika

  1. Tilgængelighed. Brugervenlig platform med lav indgangsbarriere.
  2. Funktioner. Text-to-video, image-to-video, lip sync, video editing med AI.
  3. Styrker. Hurtig generering, god til korte klip og social media-indhold.

Stable Video Diffusion (Stability AI)

  1. Open source. Kan downloades og køres lokalt.
  2. Styrker. Fuld kontrol. Community-drevet udvikling med custom modeller og extensions.
  3. Begrænsninger. Lavere kvalitet end de lukkede modeller. Kræver kraftig hardware (GPU med meget VRAM).

Google Veo 3.1

  1. Googles nyeste model. Tilgængelig via Gemini API, Vertex AI og Google AI Studio.
  2. Styrker. God fotorealisme og fysik-forståelse. Genererer synkroniseret lyd med video. Op til 1080p.
  3. Integration. Integreret i Googles AI-økosystem via Gemini og Flow.

Hvad kan text-to-video i dag?

Det der fungerer godt

  1. Landskaber og naturoptagelser. Flyvende drone over bjerge, bølger på en strand, skyer der driver. Relativt simpel bevægelse, imponerende resultater.
  2. Stemningsbilleder. Atmosphæriske klip med belysning, vejr og stemning. Regn på en vinduesrude, solopgang over en by.
  3. Enkle handlinger. Én person der går, drejer hovedet, løfter en kop. Klare, simple bevægelser.
  4. Stiliseret video. Animations-stil, low-fi æstetik, kunstneriske effekter. Mindre krav til fotorealisme.
  5. Korte klip. 4-15 sekunder med fokuseret indhold. Jo kortere, jo bedre kvalitet.

Det der stadig er svært

  1. Komplekse interaktioner. To personer der giver hinanden hånden, et barn der fanger en bold. Fysisk kontakt mellem objekter er upålideligt.
  2. Hænder og fingre. Samme problem som i text-to-image. Forstærket af bevægelse.
  3. Konsistent karakter. Den samme person skal se ens ud gennem hele videoen. Ansigter kan morphe subtilt.
  4. Tekst i video. Skrift på skilte, skærme og objekter er ofte usammenhængende.
  5. Lang video. Kvaliteten og konsistensen falder med længden. Over 30 sekunder er stadig udfordrende.
  6. Præcis kontrol. Du kan beskrive hvad du vil. Men at kontrollere præcis timing, kamerabevægelser og redigering er begrænset.

Input-varianter

Text-to-video

Skriv en prompt, få en video. Den mest grundlæggende form.

Image-to-video

Upload et stillbillede, beskriv hvordan det skal animeres:

  1. Et portræt → personen smiler og drejer hovedet.
  2. Et landskab → kameraet panorerer langsomt, skyer bevæger sig.
  3. Et produktfoto → produktet roterer, lys skifter.
  4. Fordel. Mere kontrol over udgangspunktet end ren text-to-video.

Video-to-video

Transformér en eksisterende video:

  1. Ændr stil: realistisk video → animations-stil.
  2. Ændr omgivelser: kontor → strand.
  3. Ændr tid: dag → nat.
  4. Fordel. Bevarer bevægelse og timing fra originalen. Mere forudsigelig end ren generering.

Kamerakontrol

Specificér kamerabevægelser:

  1. “Langsom dolly ind mod ansigtet.”
  2. “Drone shot oppefra med spiral-bevægelse.”
  3. “Håndholdt kamera der følger personen.”
  4. Begrænsning. Ikke alle modeller understøtter præcis kamerakontrol.

Anvendelser

Marketing og reklame

  1. Produktvideoer. Vis et produkt i brug uden et dyrt videoshoot.
  2. Social media. Korte, engagerende klip til Instagram Reels, TikTok og LinkedIn.
  3. Annoncevarianter. Generer 10 varianter af en annonce til A/B-test.
  4. Konceptvisualisering. Vis en kampagneidé visuelt inden det endelige shoot godkendes.

Film og underholdning

  1. Storyboarding. Animerede storyboards der viser scener i bevægelse.
  2. Previsualisering. Regissører kan visualisere scener før de filmes.
  3. B-roll. Stemningsbilleder og establishing shots genereret med AI.
  4. Indie-produktion. Skab visuelt imponerende indhold med begrænset budget.

Uddannelse og kommunikation

  1. Forklaringsvideoer. Visualisér abstrakte koncepter: “Vis hvordan en celle deler sig.”
  2. Historiske visualiseringer. “En markedsplads i vikingtidens Danmark.”
  3. Præsentationer. Dynamiske visuals i stedet for statiske slides.

E-commerce

  1. Produktdemoer. Vis produktet fra alle vinkler med AI-genereret video.
  2. Lifestyle-indhold. Vis produktet i brug i forskellige miljøer.
  3. Personalisering. Generer produktvideoer tilpasset forskellige målgrupper.

Text-to-video i praksis

Eksempel: social media-content

  1. Behov. 15 korte videoklip til en måneds social media-indhold.
  2. Traditionelt. Videograf, lokation, skuespillere, redigering. 30.000-100.000 kr.
  3. Med AI. Skriv 15 prompts, generer varianter, vælg de bedste, tilføj tekst og musik.
  4. Tid. 4 timer i stedet for 2 uger. Supplement til (ikke erstatning for) professionelt indhold.

Eksempel: produktlancering

  1. Behov. Teaser-video der viser produktet i 5 forskellige miljøer.
  2. Traditionelt. 5 locations, fotograf, produktion. Uger af arbejde.
  3. Med AI. Image-to-video: upload produktfoto → generer 5 miljø-varianter → vælg og redigér.
  4. Brug. Intern præsentation og early-stage marketing. Professionelt shoot for den endelige kampagne.

Eksempel: undervisningsvideo

  1. Behov. Visualisér solsystemets dannelse til en astronomilektion.
  2. Traditionelt. Professionel 3D-animation. Dyrt og tidskrævende.
  3. Med AI. Prompt: “Timelapse af solsystemets dannelse, gas og støv der samler sig til planeter, episk skala, filmisk belysning.”
  4. Resultat. Ikke perfekt. Men godt nok til at illustrere konceptet visuelt for elever.

Sammenligning af text-to-video modeller

ModelMax længdeKvalitetPrisTilgængelighed
Sora 2 (OpenAI)25 sekMeget højChatGPT Plus/ProLukket, abonnement
Runway Gen-4.510 sekMeget højFra $12/mdWeb, API
Kling 3.015 sekHøjGratis + premiumWeb
Pika4 sekGodGratis + premiumWeb
Stable Video~4 sekModeratGratis (open source)Lokalt
Google Veo 3.18 sekHøjGemini API / Vertex AIWeb, API

Etik og udfordringer

Deepfakes

  1. Text-to-video gør det nemmere at skabe overbevisende falske videoer.
  2. Politiske deepfakes, falske nyhedsklip og svindel er reelle risici.
  3. Modellerne har typisk sikkerhedsforanstaltninger mod at generere kendte personers ansigter.
  4. Detektionsteknologi udvikles parallelt. Men kapløbet er reelt.

Ophavsret

  1. Modellerne er trænet på millioner af videoer fra internettet. Mange ophavsretsbeskyttede.
  2. Juridiske spørgsmål om træninsdata, output-ejerskab og kommerciel brug er uafklarede.
  3. Samme debat som for text-to-image, men forstærket af videomediet.

Impact på videobranchen

  1. Stock video-markedet er under pres.
  2. Motion graphics og simple animationer kan i stigende grad genereres med AI.
  3. Professionelle videoproducenter skifter fokus fra produktion til kreativ ledelse og AI-styring.
  4. Nye roller opstår: AI video director, prompt specialist, AI-assisteret redigerer.

Kvalitetsforventninger

  1. AI-genereret video er endnu ikke på niveau med professionel produktion.
  2. “Uncanny valley”-effekten: video der er næsten realistisk men ikke helt virker mere forstyrrende end åbenlyst stiliseret indhold.
  3. For kommerciel brug på højt niveau supplerer AI stadig snarere end erstatter professionel videoproduktion.

Fremtiden for text-to-video

Længere videoer

  1. Fra sekunder til minutter til timer. Modeller der kan opretholde konsistens over længere forløb.
  2. Narrativ sammenhæng: AI der forstår at en video skal fortælle en historie med begyndelse, midte og slutning.

Bedre kontrol

  1. Præcis kamerakontrol: angle, bevægelse, hastighed.
  2. Karakterkonsistens: den samme person i alle scener.
  3. Timing og redigering: kontrol over hvornår ting sker i videoen.
  4. Lyd-integration: AI-genereret video med matchende lydeffekter og musik.

Realtidsgenerering

  1. Video genereret i realtid baseret på brugerens input.
  2. Interaktiv video: seeren bestemmer hvad der sker næste gang.
  3. Gaming: procedurel videogenerering i spil.

Integration i workflows

  1. Text-to-video som ét trin i en videoproduktions-pipeline.
  2. Kombineret med traditionel redigering, motion graphics og VFX.
  3. AI som kreativ assistent. Ikke erstatning for hele produktionsprocessen.

Text-to-video er den næste grænse for generativ AI Text-to-image viste at AI kan skabe overbevisende stillbilleder. Text-to-video tager det et skridt videre og viser at AI kan forstå bevægelse, tid og fysik. Teknologien er stadig ung: videoerne er korte, kontrollen er begrænset, og kvaliteten kan variere. Men udviklingshastigheden er enorm. Hvad der var umuligt for to år siden er nu tilgængeligt for alle med et abonnement. For virksomheder og kreative er det vigtigste at forstå hvad teknologien kan nu, hvad den ikke kan endnu, og hvordan den bedst bruges som supplement til (ikke erstatning for) menneskelig kreativitet og professionel produktion.


FAQ

Hvad er text-to-video AI?

Text-to-video er AI-teknologi der genererer videoklip baseret på tekstbeskrivelser. Du skriver f.eks. "En hund der løber på en strand ved solnedgang," og AI'en skaber et videoklip med bevægelse, belysning og realistisk fysik. Kendte modeller er Sora 2 (OpenAI), Runway Gen-4.5, Kling 3.0 og Google Veo 3. Teknologien er baseret på diffusionsmodeller udvidet til det temporale domæne.

Hvilken text-to-video AI er bedst?

Runway Gen-4.5 topper benchmarks for visuel kvalitet og prompt-adherence. Sora 2 (OpenAI) er stærk på fotorealisme med op til 25 sekunders video. Kling 3.0 tilbyder multi-shot storyboarding i op til 4K/60fps. Google Veo 3.1 genererer video med synkroniseret lyd. Valget afhænger af behov: kvalitet, længde, pris og brugervenlighed.

Kan man lave en hel film med AI?

Endnu ikke i professionel kvalitet. AI kan generere korte klip (4-25 sekunder), men at opretholde konsistente karakterer, narrativ sammenhæng og professionel kvalitet over en hel film er stadig uden for teknologiens rækkevidde. AI bruges i dag bedst til konceptvisualisering, storyboarding, B-roll og korte klip der redigeres sammen med traditionelt produceret indhold.

Er text-to-video gratis?

Nogle modeller har gratis niveauer med begrænsninger: Pika og Kling tilbyder gratis klip med lavere opløsning eller vandmærker. Stable Video Diffusion er open source og gratis at køre lokalt (kræver kraftig GPU). Sora kræver ChatGPT Plus ($20/md) eller Pro ($200/md). Runway starter fra $12/md. For professionel brug er et abonnement typisk nødvendigt.


Relaterede termer