Spring til indhold
AI Ordbog

AI Ordbog

Image-to-text

AI-teknologi der analyserer billeder og genererer tekstbeskrivelser af indholdet.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er image-to-text?

Image-to-text er en AI-teknologi der tager et billede som input og genererer en tekstbeskrivelse af billedets indhold. Teknologien kombinerer computer vision (billedforståelse) med naturlig sproggeneration for at “se” og “beskrive” hvad der er på et billede.

Hvor OCR fokuserer specifikt på at genkende tekst i billeder, går image-to-text bredere og kan beskrive scener, objekter, handlinger og relationer mellem elementer i et billede. En moderne image-to-text-model kan for eksempel se et foto fra en park og generere: “En kvinde sidder på en bænk og læser en bog, mens en golden retriever ligger ved hendes fødder.”

Hvordan fungerer image-to-text?

Image-to-text bygger typisk på to sammenkoblede systemer:

  1. En visuel encoder der analyserer billedet og omdanner det til en numerisk repræsentation (embedding). Denne del bruger ofte et convolutional neural network (CNN) eller en vision transformer (ViT) til at identificere objekter, farver, positioner og relationer.

  2. En sprogdecoder der tager den visuelle repræsentation og genererer en naturlig tekstbeskrivelse. Denne del bruger en sprogmodel, typisk baseret på transformer-arkitekturen, til at formulere sammenhængende sætninger.

Moderne multimodale modeller som GPT-4o, Claude og Gemini integrerer begge dele i én samlet arkitektur, hvilket giver dem en mere samlet forståelse af billeder.

Tre tilgange til image-to-text

TilgangBeskrivelseEksempel
Image captioningGenererer en kort, sammenfattende beskrivelse af billedet“En kat der sover på en rød sofa”
Visual Question Answering (VQA)Besvarer specifikke spørgsmål om billedets indhold“Hvilken farve har sofaen?” → “Rød”
Detaljeret billedanalyseGenererer en grundig, struktureret beskrivelse af alle elementerFuld beskrivelse af scene, objekter, stemning og detaljer

Hvad bruges image-to-text til?

Tilgængelighed (accessibility)

En af de vigtigste anvendelser er at gøre visuelt indhold tilgængeligt for synshandicappede. Image-to-text kan automatisk generere alt-tekster til billeder på websites, i apps og på sociale medier, så skærmlæsere kan formidle billedets indhold.

Søgning og organisering af billeder

Image-to-text gør det muligt at søge i store billedsamlinger med tekstforespørgsler. I stedet for manuelt at tagge tusindvis af billeder kan AI automatisk beskrive indholdet og gøre det søgbart. Det bruges af:

  • Mediearkiver og nyhedsredaktioner til at finde relevante billeder hurtigt
  • E-commerce til automatisk at generere produktbeskrivelser fra produktfotos
  • Digital Asset Management til at kategorisere og organisere billedbiblioteker

Indholdsmoderation

Sociale medier og platforme bruger image-to-text til at identificere og moderere upassende billeder. Ved at konvertere billedindhold til tekst kan eksisterende tekstbaserede moderationsregler også anvendes på billeder.

Dokumentforståelse

Kombineret med OCR kan image-to-text forstå komplekse dokumenter der indeholder både tekst, tabeller, diagrammer og billeder. Det bruges til at automatisere dataindtastning fra fakturaer, formularer og rapporter.

Praktiske eksempler

Eksempel 1: Automatisk alt-tekst

Du uploader et produktfoto til din webshop. I stedet for manuelt at skrive en billedbeskrivelse, analyserer AI billedet og foreslår:

“Sort læderjakke med sølvfarvet lynlås, fotograferet på en hvid bøjle mod en lys grå baggrund.”

Eksempel 2: Multimodal AI-chat

Du sender et foto af din plantevæg til Claude og spørger: “Hvad fejler denne plante?” Modellen analyserer billedet, identificerer planten og de synlige symptomer, og svarer med en diagnose og plejeråd.

Eksempel 3: Automatiseret rapportanalyse

En virksomhed uploader kvartalsrapporter som PDF med grafer og tabeller. Image-to-text-modellen læser graferne og genererer tekstbeskrivelser som: “Omsætningen steg med 23% i Q3 sammenlignet med Q2, primært drevet af vækst i det nordiske marked.”

Kendte modeller og værktøjer

  • GPT-4o / GPT-4 Vision, OpenAIs multimodale model der kan analysere billeder og besvare spørgsmål om dem
  • Claude (Anthropic), kan analysere billeder, dokumenter og screenshots med høj præcision
  • Gemini (Google), Googles multimodale model med stærk billedforståelse
  • BLIP-2, Salesforces open source-model specifikt designet til image captioning og VQA
  • LLaVA, open source multimodal model der kombinerer en vision encoder med en sprogmodel
  • Florence-2 (Microsoft), kompakt model med stærk performance på billedforståelsesopgaver

Udfordringer og begrænsninger

Hallucination

Ligesom sprogmodeller kan hallucinere tekst, kan image-to-text-modeller “se” ting der ikke er i billedet. En model kan for eksempel beskrive en person som smilende, selvom ansigtsudtrykket er neutralt.

Kulturel og kontekstuel forståelse

Modellerne kan have svært ved at forstå kulturspecifikke elementer, symbolik eller kontekst der kræver baggrundsviden. Et billede af en dansk pølsevogn kræver kulturel viden for at blive korrekt identificeret.

Bias i billedbeskrivelser

Modellerne kan afspejle bias fra træningsdata, for eksempel ved at tilskrive kønsspecifikke roller eller lave fejlagtige antagelser baseret på udseende.

Detaljeniveau

Der er en balancegang mellem at generere for korte beskrivelser (der mangler vigtig information) og for detaljerede beskrivelser (der overbelaster brugeren). Det optimale detaljeniveau afhænger af anvendelsen.

Forskellen på image-to-text og OCR

Image-to-textOCR
FormålBeskrive billedets visuelle indholdUdtrække eksisterende tekst fra billeder
InputEthvert billede (fotos, illustrationer, screenshots)Billeder der indeholder tekst
OutputNy tekst der beskriver hvad billedet viserGengivelse af den tekst der allerede findes i billedet
Eksempel“Et skilt med hvid tekst på blå baggrund ved en motorvej”“København 45 km”

I praksis kombineres de to teknologier ofte. En multimodal AI-model kan både genkende tekst i et billede (OCR) og beskrive den visuelle kontekst (image-to-text).

Ofte stillede spørgsmål

Hvad er image-to-text?

Image-to-text er en AI-teknologi der analyserer billeder og automatisk genererer tekstbeskrivelser af indholdet. Det bruges til alt fra tilgængelighed og billedsøgning til automatisk produktbeskrivelse og dokumentforståelse.

Hvordan adskiller image-to-text sig fra OCR?

OCR (Optical Character Recognition) genkender og udtrækker eksisterende tekst fra billeder, mens image-to-text genererer nye tekstbeskrivelser af billedets visuelle indhold: objekter, scener, handlinger og relationer.

Hvilke AI-modeller kan lave image-to-text?

De mest kendte er GPT-4o (OpenAI), Claude (Anthropic) og Gemini (Google). Derudover findes open source-modeller som BLIP-2, LLaVA og Florence-2 der er specifikt designet til billedforståelse og captioning.

Kan image-to-text bruges til automatisk at generere alt-tekster?

Ja, det er en af de mest populære anvendelser. AI kan analysere billeder og foreslå beskrivende alt-tekster der gør visuelt indhold tilgængeligt for skærmlæsere og synshandicappede brugere. Mange CMS-systemer og platforme integrerer allerede denne funktionalitet.


Relaterede termer