Spring til indhold
AI Ordbog

AI Ordbog

Vision model

En AI-model der kan forstå, analysere og ræsonnere over billeder og visuelle data, enten alene eller i kombination med tekst.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er en vision model?

En vision model er en AI-model der kan “se”. Den kan modtage billeder som input og forstå, analysere og ræsonnere over deres indhold. Det kan være alt fra at identificere objekter i et foto til at læse tekst i et dokument, analysere grafer i en rapport eller beskrive hvad der sker i en kompleks scene.

Termen dækker et bredt spektrum af modeller. I den ene ende er specialiserede modeller der kun laver én ting (som at klassificere billeder af hudlæsioner som godartede eller ondartede). I den anden ende er store multimodale modeller som GPT-4o, Claude og Gemini der kan se billeder og ræsonnere over dem i kombination med tekst, præcis som et menneske der kigger på et billede og diskuterer det.

Det er den anden type (multimodale vision models) der har drevet den seneste udvikling. For første gang kan AI-modeller ikke bare se hvad der er på et billede men forstå kontekst, læse tekst, fortolke diagrammer og besvare komplekse spørgsmål om visuelt indhold.

Fra billedgenkendelse til visuel forståelse

Første generation: Klassificering (2012-2017)

De tidlige vision models var specialiserede klassificeringsmodeller. De kunne svare på spørgsmålet “Hvad er dette?” med en label:

Billede af en kat → "kat" (97% sikkerhed)
Røntgenbillede → "lungebetændelse" (84% sikkerhed)
Foto af bil → "Tesla Model 3" (91% sikkerhed)

AlexNet (2012), VGG, ResNet og lignende modeller forandrede billedklassificering men var begrænset til foruddefinerede kategorier.

Anden generation: Detektion og segmentering (2017-2020)

Næste generation kunne ikke bare klassificere hele billeder men finde og afgrænse specifikke objekter:

Foto af en gade → [Bil (position: x,y,w,h), Person (position: x,y,w,h), Cykel (position: x,y,w,h)]

Modeller som YOLO, Faster R-CNN og Mask R-CNN muliggjorde realtidsobjektdetektion i video, selvkørende biler og kvalitetskontrol i produktion.

Tredje generation: Multimodal forståelse (2021-nu)

Den aktuelle generation kombinerer vision med sprogforståelse. Modellen ser ikke bare billeder. Den forstår dem og kan tale om dem:

Billede af en graf + "Hvad viser denne graf?" →
"Grafen viser Novo Nordisks omsætningsvækst fra 2020 til 2025.
Omsætningen er steget fra 127 mia. kr. til 290 mia. kr.,
primært drevet af GLP-1-produkter. Væksten accelererer
markant fra 2023."

Denne generation (repræsenteret af GPT-4o, Claude, Gemini og Llama med vision) er et kvalitativt spring. Modellen ræsonnerer over det visuelle indhold, ikke bare klassificerer det.

Hvordan fungerer moderne vision models?

Vision Transformer (ViT)

De fleste moderne vision models bygger på Vision Transformer-arkitekturen. I stedet for at behandle et billede pixel for pixel, opdeles billedet i patches (typisk 16×16 eller 14×14 pixels), og hver patch behandles som et “token”. Ligesom ord i en sprogmodel:

Billede (224×224 pixels)
    ↓
Opdel i patches (14×14 = 196 patches á 16×16 pixels)
    ↓
Konvertér hver patch til en vektor (embedding)
    ↓
Processer med transformer-attention (præcis som tekst-tokens)
    ↓
Visuel forståelse

Denne tilgang gør det muligt at bruge den samme transformer-arkitektur til både tekst og billeder. Det er fundamentet for multimodale modeller.

Multimodale modeller: Vision + sprog

Moderne multimodale modeller kombinerer en vision encoder med en sprogmodel:

Billede → Vision encoder → Visuelle tokens
                                    ↓
Tekst-prompt → Tokenizer → Tekst-tokens → [Kombiner] → Sprogmodel → Svar

Vision encoderen (typisk en ViT eller CLIP-variant) konverterer billedet til en sekvens af visuelle tokens der repræsenterer billedets indhold.

Sprogmodellen modtager de visuelle tokens sammen med tekst-tokens og kan dermed ræsonnere over begge modaliteter simultant.

Det er som at give sprogmodellen øjne. Den “læser” billedet som en sekvens af visuelle tokens, ligesom den læser tekst som en sekvens af tekst-tokens.

CLIP: Broen mellem billeder og tekst

CLIP (Contrastive Language-Image Pre-training) fra OpenAI var et gennembrud der lærte en model at forstå sammenhængen mellem billeder og tekst. CLIP blev trænet på 400 millioner billede-tekst-par fra internettet og lærte at matche billeder med deres beskrivelser.

CLIP’s tilgang bruges som vision encoder i mange moderne multimodale modeller og muliggør zero-shot billedforståelse: modellen kan forstå billedtyper den aldrig har set eksplicit under træning.

Typer af vision models

Billedklassificering

Tildeler en label til et helt billede. Bruges til kvalitetskontrol, medicinsk diagnostik, indholdsmoderering og organisering af fotobiblioteker.

Objektdetektion

Finder og lokaliserer specifikke objekter i et billede med bounding boxes. Bruges til selvkørende biler, overvågning, detailhandel (hylde-analyse) og droner.

Segmentering

Klassificerer hver pixel i et billede. Bruges til medicinsk billedanalyse (tumor-afgrænsning), autonom kørsel (vejbane-detektion) og billedredigering.

OCR og dokumentforståelse

Læser og forstår tekst i billeder, dokumenter og scannede filer. Moderne vision models kan ikke bare læse teksten men forstå dokumentets layout, tabeller, formularer og kontekst.

Multimodal ræsonnering

Besvarer komplekse spørgsmål der kræver forståelse af billede og tekst i kombination. Kan analysere grafer, fortolke diagrammer, forstå memes og ræsonnere over visuelle scener.

Praktiske anvendelser

Dokumentanalyse og dataekstraktion

En af de mest værdiskabende anvendelser i erhvervslivet. Vision models kan:

  • Læse og forstå fakturaer, kvitteringer og kontrakter
  • Ekstrahere data fra scannede dokumenter og PDF’er
  • Forstå tabelstrukturer og grafer i rapporter
  • Konvertere håndskrevet tekst til digital tekst

Eksempel: En revisor modtager 500 fakturaer i forskellige formater. En vision model kan ekstrahere leverandør, beløb, dato, momssats og varebeskrivelser fra alle fakturaer (uanset layout og format) og strukturere data i et regneark.

Medicinsk diagnostik

Vision models bruges i stigende grad til at assistere læger:

  • Analyse af røntgenbilleder, CT-scanninger og MR-billeder
  • Detektion af hudkræft fra dermatoskopibilleder
  • Retinal screening for diabetisk øjensygdom
  • Patologi: analyse af vævsprøver

Modellerne erstatter ikke lægen men fungerer som et “ekstra par øjne” der kan fange ting mennesker overser og prioritere de mest bekymrende cases.

Kvalitetskontrol i produktion

Industrielle vision models inspicerer produkter på samlebånd:

  • Detektion af ridser, revner og defekter på overflader
  • Verifikation af korrekt montering og komponentplacering
  • Måling af dimensioner og tolerancer
  • Sortering af produkter efter kvalitet

Eksempel: En chipproducent bruger vision models til at inspicere halvledere for mikroskopiske defekter. Modellen analyserer tusindvis af billeder i minuttet med en præcision der overgår menneskelige inspektører.

Detailhandel og e-handel

  • Visuel produktsøgning (“find lignende produkter”)
  • Automatisk kategorisering af produktbilleder
  • Analyse af hyldeplacering og lagerstatus i fysiske butikker
  • Virtuel prøverum (tøj, møbler, briller)

Autonome systemer

Selvkørende biler, droner og robotter bruger vision models til at forstå deres omgivelser:

  • Detektion af fodgængere, cyklister, skilte og vejbaner
  • Afstandsestimering og dybdeopfattelse
  • Navigering i komplekse miljøer
  • Undgåelse af forhindringer

AI-kodningsassistenter

Vision models gør det muligt for AI-kodningsassistenter at arbejde med visuelle inputs:

  • Konvertere screenshots af UI-designs til kode
  • Forstå fejlbeskeder fra screenshots
  • Analysere diagrammer og arkitekturtegninger
  • Læse og forstå whiteboard-skitser

Tilgængelighed

Vision models gør visuelt indhold tilgængeligt for synshæmmede:

  • Detaljerede beskrivelser af billeder og scener
  • Læsning af tekst i billeder, skilte og dokumenter
  • Navigation i fysiske miljøer via smartphonekamera
  • Beskrivelse af visuelle elementer på websites

Vision models hos de store udbydere

OpenAI (GPT-4o, GPT-4 Vision)

GPT-4o integrerer vision som en kernekompetence. Modellen kan analysere billeder med høj detalje, forstå komplekse visuelle scener og ræsonnere over billedindhold i kombination med tekst. Understøtter multiple billeder i samme forespørgsel.

Anthropic (Claude)

Claude’s vision-kapabiliteter understøtter analyse af billeder, dokumenter, grafer og diagrammer. Claude er særligt stærk til dokumentforståelse og kan analysere komplekse PDF’er, tabeller og tekniske tegninger.

Google (Gemini)

Gemini er bygget som en multimodal model fra bunden. Vision er ikke tilføjet efterfølgende men integreret i arkitekturen. Gemini understøtter billeder, video og interleaved tekst-billede inputs med op til 2 millioner tokens kontekst.

Open source

Modeller som LLaVA, Llama 3.2 Vision, InternVL og Qwen-VL giver open source-adgang til stærke vision-kapabiliteter. Disse kan selvhostes og finjusteres til specifikke domæner.

Specialiserede vs. generelle vision models

Specialiseret vision modelGenerel multimodal model
OpgaveÉn specifik opgave (f.eks. defektdetektion)Mange forskellige visuelle opgaver
PræcisionMeget høj for sin opgaveGod til mange opgaver, sjældent bedst
TræningDomænespecifik dataBred multimodal træning
TilpasningKræver finjusteringZero-shot eller few-shot
HastighedOptimeret, hurtigLangsommere (større model)
PrisBillig per inferenceDyrere per inference
Bedst tilProduktionspipelines med kendt opgaveFleksible, varierende opgaver

For de fleste virksomheder er den praktiske tilgang: brug generelle multimodale modeller til prototyping og varierede opgaver, og skift til specialiserede modeller når en specifik opgave skal optimeres for præcision, hastighed eller pris.

Begrænsninger

Hallucination i visuel kontekst

Vision models kan “se” ting der ikke er der eller fejlfortolke visuelt indhold. En model kan påstå at et tal i en graf er 42 når det er 47, eller beskrive et objekt der ikke findes i billedet. Visuel hallucination er et aktivt forskningsområde.

Rumlig forståelse

Modellerne er generelt svagere til præcis rumlig ræsonnering (“er den røde bold til venstre eller højre for den blå?”) end til indholdsbeskrivelse. De kan beskrive hvad de ser men har sværere ved at ræsonnere præcist over positioner og afstande.

Billedkvalitet

Dårlig billedkvalitet (slørede billeder, dårlig belysning, lav opløsning) reducerer modellens evne til at forstå indholdet. For kritiske anvendelser som medicinsk diagnostik er billedkvalitet afgørende.

Bias

Vision models arver bias fra deres træningsdata. De kan være bedre til at genkende objekter og scener fra vestlige kulturer end fra andre. Ansigts- og personanalyse kan have bias baseret på etnicitet, køn og alder.

Privatlivs- og etiske overvejelser

Vision models der analyserer billeder af mennesker rejser vigtige spørgsmål om privatliv, samtykke og overvågning. Ansigtsgenkendelsesteknologi er reguleret i mange jurisdiktioner, og EU AI Act stiller strenge krav til biometrisk identifikation.

Ofte stillede spørgsmål

Hvad er en vision model?

En vision model er en AI-model der kan forstå, analysere og ræsonnere over billeder og andre visuelle data. Moderne vision models kan beskrive hvad der er på et billede, læse tekst i dokumenter, analysere grafer og diagrammer, og besvare komplekse spørgsmål om visuelt indhold. De spænder fra specialiserede modeller til én opgave (f.eks. defektdetektion) til store multimodale modeller som GPT-4o, Claude og Gemini der kombinerer visuel forståelse med sproglig ræsonnering.

Hvad er forskellen på en vision model og computer vision?

Computer vision er det brede fagområde der handler om at give computere evnen til at forstå visuelle data. En vision model er en specifik AI-model der implementerer computer vision-kapabiliteter. Traditionel computer vision brugte regelbaserede algoritmer og håndskrevne features. Moderne vision models er neurale netværk (typisk baseret på transformer-arkitekturen) der lærer at forstå billeder direkte fra data. De mest avancerede vision models i dag er multimodale og kombinerer billedforståelse med sproglig forståelse.

Kan vision models erstatte menneskelig inspektion?

For mange rutineopgaver ja, vision models kan inspicere produkter hurtigere og mere konsistent end mennesker, og de bliver aldrig trætte eller distraherede. For kritiske beslutninger (som medicinsk diagnostik eller sikkerhedsinspektioner) bruges vision models typisk som et støtteværktøj der assisterer mennesker snarere end erstatter dem. Modellerne kan prioritere cases, fange ting mennesker overser og fungere som et “ekstra par øjne”, men den endelige vurdering forbliver hos fagpersonen.

Hvilke billedformater kan vision models forstå?

De fleste vision models understøtter standard billedformater som JPEG, PNG, GIF og WebP. Mange kan også analysere PDF-dokumenter, screenshots og fotografier taget med smartphone-kameraer. Avancerede modeller som Gemini kan desuden analysere video. Ikke bare individuelle billeder men sekvenser af frames. Billedkvalitet og opløsning påvirker modellens præcision, så højopløselige billeder giver generelt bedre resultater.


Relaterede termer