Spring til indhold
AI Ordbog

AI Ordbog

World model

Et neuralt netværk der forstår og simulerer den fysiske verden.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er et world model?

Et world model er et neuralt netværk der lærer at forstå og simulere den fysiske verdens dynamik. Hvor en sprogmodel forudsiger det næste ord i en sætning, forudsiger et world model hvad der sker næste gang i en fysisk scene: hvordan objekter bevæger sig, kolliderer, falder og interagerer.

World models lærer ved at observere video, simuleringsdata og andre rumlige inputs. De bygger interne repræsentationer af objekter, scener og fysisk dynamik. Målet er modeller der forstår begreber som tyngdekraft, okklusion, objektpermanens og årsag-virkning uden at være eksplicit programmeret til det.

Hvorfor world models?

Sprogmodeller forstår tekst. World models forstår verden. Det er en fundamental forskel:

  1. Fysisk forståelse. Et world model ved at en bold der kastes op vil falde ned igen. En sprogmodel ved det kun fordi den har læst tekst der beskriver det.
  2. Kausalitet. World models forstår årsag og virkning i fysiske systemer. De kan forudsige konsekvenser af handlinger i en scene.
  3. Generalisering. Et world model der forstår fysik kan generalisere til nye scenarier. Det behøver ikke at have set præcis den situation før.

Yann LeCun, tidligere Chief AI Scientist hos Meta og nu medstifter af AMI Labs, har argumenteret for at world models er bedre egnet til “menneskelig intelligens” end sprogmodeller. Hans argument: mennesker forstår verden primært gennem observation og interaktion, ikke gennem tekst.

Eksempler

  1. Genie (Google DeepMind). Genie 3, udgivet i august 2025, var det første interaktive world model i realtid. Det genererer navigerbare 3D-verdener med 24 billeder per sekund.
  2. Marble (World Labs). Lanceret i november 2025, kan Marble skabe hele 3D-verdener fra en tekst-prompt, et billede, en video eller et groft 3D-layout. World Labs er grundlagt af Fei-Fei Li.
  3. DIAMOND. Et world model der kan simulere Atari-spil i realtid baseret på at have observeret gameplay.
  4. Cosmos (NVIDIA). NVIDIAs world model-platform designet til at generere syntetiske data til robotik og autonome køretøjer.

World models vs. videomodeller

World models og videomodeller (som Sora) genererer begge video, men der er en vigtig forskel:

  1. Videomodeller genererer visuelt overbevisende video. De fokuserer på at billederne ser rigtige ud.
  2. World models genererer fysisk korrekt video. De fokuserer på at fysikken er rigtig: objekter har masse, tyngdekraft virker, kollisioner er realistiske.

I praksis flyder grænsen. Avancerede videomodeller lærer implicit noget fysik, og world models bruger videomodeller som en komponent.

World models er AI’s vej til at forstå virkeligheden Sprogmodeller forstår hvad vi siger om verden. World models forstår verden selv. Det er en fundamental forskel der kan vise sig at være afgørende for at bygge AI-systemer der kan interagere sikkert med den fysiske verden: robotter, autonome køretøjer og industrielle systemer.


FAQ

Hvad er et world model?

Et world model er et neuralt netværk der forstår den fysiske verdens dynamik. Hvor en sprogmodel forudsiger det næste ord, forudsiger et world model hvad der sker næste gang i en fysisk scene: hvordan objekter bevæger sig, kolliderer, falder og interagerer.

Hvad er forskellen på world models og sprogmodeller?

Sprogmodeller forudsiger ord baseret på tekst. World models forudsiger hvad der sker i den fysiske verden baseret på video og rumlige data. Sprogmodeller forstår sprog. World models forstår fysik, rum og kausalitet.

Hvem arbejder med world models?

Google DeepMind (Genie), World Labs (Marble), NVIDIA og flere. Yann LeCun, tidligere Chief AI Scientist hos Meta og nu medstifter af AMI Labs, har argumenteret for at world models er vejen til menneskelig intelligens, ikke sprogmodeller.


Relaterede termer