Spring til indhold
AI Ordbog

AI Ordbog

OCR (Optical Character Recognition)

Teknologi der genkender og udtrækker tekst fra billeder og dokumenter.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er OCR?

OCR (Optical Character Recognition) er en teknologi der genkender tekst i billeder og konverterer den til maskinlæsbar tekst. Når du tager et foto af en kvittering, scanner et dokument eller uploader en PDF, kan OCR automatisk udtrække al teksten, så den kan søges i, redigeres og behandles digitalt.

OCR har eksisteret i årtier, men moderne AI-drevet OCR er fundamentalt mere kraftfuld end traditionel OCR. Hvor ældre systemer krævede perfekt scannede dokumenter med standardskrifttyper, kan AI-baseret OCR håndtere håndskrift, skæve billeder, dårlig belysning og komplekse layouts med tabeller, kolonner og grafik.

Hvordan fungerer OCR?

Traditionel OCR

Klassisk OCR fungerer i tre trin:

  1. Forbehandling. Billedet renses: kontrast justeres, skævhed rettes, og støj fjernes
  2. Segmentering. Teksten opdeles i linjer, ord og individuelle tegn
  3. Genkendelse. Hvert tegn sammenlignes med kendte mønstre og identificeres

Denne tilgang virker godt på rene, scannede dokumenter med standardskrifttyper, men fejler ofte på fotos fra virkeligheden.

AI-drevet OCR

Moderne OCR bruger deep learning. Typisk convolutional neural networks (CNN) og transformer-arkitekturer. Det gør det muligt at genkende tekst direkte i billeder uden at skulle isolere individuelle tegn først:

  1. Feature extraction. Et neuralt netværk analyserer billedet og identificerer tekstregioner
  2. Sekvensgenkendelse. En recurrent eller transformer-baseret model læser hele ord og sætninger i kontekst
  3. Sprogmodellering. En sprogmodel korrigerer fejl baseret på kontekst (f.eks. at “rnaskinlæring” sandsynligvis skal være “maskinlæring”)

Denne tilgang giver markant bedre resultater, især på:

  • Håndskrevet tekst
  • Billeder taget med mobilkameraer
  • Dokumenter med komplekse layouts
  • Tekst på buede overflader eller i perspektiv

Multimodal OCR

De nyeste multimodale AI-modeller som GPT-4o, Claude og Gemini har OCR-kapabilitet indbygget. De kan ikke bare udtrække tekst, men også forstå dokumentets struktur, kontekst og betydning. Du kan uploade et billede af en faktura og bede modellen om at udtrække specifikke felter som beløb, dato og leverandørnavn.

Hvad bruges OCR til?

Dokumentdigitalisering

Den mest klassiske anvendelse: konvertering af fysiske dokumenter til søgbare, digitale formater. Virksomheder bruger OCR til at digitalisere arkiver med kontrakter, fakturaer, breve og rapporter. Biblioteker og museer bruger det til at gøre historiske dokumenter tilgængelige online.

Automatiseret dataindtastning

I stedet for manuelt at indtaste data fra fakturaer, formularer og kvitteringer, kan OCR automatisk udtrække relevant information:

  • Bogføring. Udtrække beløb, momssatser og kontonumre fra fakturaer
  • HR. Læse CV’er og ansøgninger automatisk
  • Forsikring. Behandle skadeanmeldelser og dokumentation
  • Sundhed. Digitalisere patientjournaler og recepter

ID-verifikation og KYC

Banker, fintechvirksomheder og offentlige tjenester bruger OCR til at læse pas, kørekort og ID-kort som del af Know Your Customer (KYC) processer. Når du tager et foto af dit kørekort i en bankapp, er det OCR der udtrækker dine oplysninger.

Tilgængelighed

OCR gør trykt tekst tilgængelig for synshandicappede ved at konvertere den til digital tekst, der kan læses op af en skærmlæser eller konverteres til punktskrift.

Nummerpladegenkendelse

Parkeringshuse, betalingsanlæg og politiets hastighedskontrol bruger specialiseret OCR til automatisk at aflæse nummerplader fra billeder og video.

Praktiske eksempler

Eksempel 1: Kvitteringsscanning

Du fotograferer en kvittering med din telefon. OCR-appen udtrækker automatisk butikkens navn, dato, individuelle vareposter med priser og det samlede beløb. Dataen eksporteres direkte til dit regnskabsprogram.

Eksempel 2: Dokumentsøgning

En advokatvirksomhed scanner 50.000 siders sagsmateriale. OCR konverterer alle sider til søgbar tekst, så juristerne kan finde relevante passager med en simpel tekstsøgning i stedet for at bladre manuelt.

Eksempel 3: Multimodal AI + OCR

Du uploader et foto af en håndskrevet opskrift til Claude og skriver: “Omskriv denne opskrift til en pæn digital version.” Modellen bruger OCR til at læse håndskriften og genererer en formateret opskrift med ingrediensliste og trinvise instruktioner.

Eksempel 4: Automatiseret fakturahåndtering

En virksomhed modtager 500 fakturaer om måneden. I stedet for manuel indtastning scanner et OCR-system alle fakturaer, udtrækker leverandør, beløb, forfaldsdato og fakturanummer, og opretter automatisk posteringer i økonomisystemet.

Kendte OCR-værktøjer og -tjenester

VærktøjTypeStyrke
Google Cloud Vision OCRCloud APIStærk på mange sprog, god til fotos
Azure AI Document IntelligenceCloud APISpecialiseret i strukturerede dokumenter (fakturaer, kvitteringer)
AWS TextractCloud APIGod til tabeller og formularer
TesseractOpen sourceGratis, fleksibel, 100+ sprog
GPT-4o / Claude / GeminiMultimodal AIForstår kontekst og struktur, ikke kun tekst
ABBYY FineReaderDesktop/cloudIndustristandard for dokumentdigitalisering

OCR-kvalitet og udfordringer

Hvad påvirker OCR-præcisionen?

  • Billedkvalitet. Skarphed, belysning og opløsning har stor betydning
  • Skrifttype og størrelse. Standardskrifttyper genkendes bedst. Dekorative skrifttyper og meget lille tekst er sværere
  • Sprog. De fleste OCR-systemer er stærkest på engelsk. Danske specialtegn (æ, ø, å) kræver sprogunderstøttelse
  • Layout-kompleksitet. Enkle tekstsider er nemmere end dokumenter med kolonner, tabeller og billeder blandet sammen
  • Håndskrift. Stadig den sværeste kategori, selvom AI har gjort store fremskridt

Typiske fejl

  • Forveksling af lignende tegn: 0 vs. O, 1 vs. l, rn vs. m
  • Tab af formatering: tabeller der læses som ustruktureret tekst
  • Forkert læserækkefølge i dokumenter med flere kolonner
  • Problemer med specialtegn og diakritiske tegn

Sådan forbedrer du OCR-resultater

  1. Brug høj opløsning. Mindst 300 DPI for scannede dokumenter
  2. Sørg for god belysning. Undgå skygger og refleksioner ved fotografering
  3. Hold dokumentet plant. Minimér skævhed og bøjning
  4. Vælg det rigtige værktøj. Brug specialiserede løsninger til specifikke dokumenttyper
  5. Efterbehandl med AI. Brug en sprogmodel til at korrigere og strukturere OCR-output

Forskellen på OCR og image-to-text

OCR og image-to-text er beslægtede men forskellige teknologier:

  • OCR udtrækker den tekst der allerede findes i billedet. Hvis billedet viser et skilt med “Åbent 9-17”, returnerer OCR netop den tekst.
  • Image-to-text genererer nye tekstbeskrivelser af billedets visuelle indhold. For det samme billede ville image-to-text måske returnere: “Et hvidt skilt med sort tekst hænger i en butiksdør.”

Moderne multimodale modeller kan gøre begge dele samtidigt.

Ofte stillede spørgsmål

Hvad er OCR?

OCR (Optical Character Recognition) er en teknologi der automatisk genkender og udtrækker tekst fra billeder, scannede dokumenter og PDF-filer. Den konverterer trykt eller håndskrevet tekst til digital, maskinlæsbar tekst der kan søges i, redigeres og behandles.

Kan OCR læse håndskrift?

Ja, moderne AI-drevet OCR kan læse håndskrift med stigende præcision. Deep learning-modeller er trænet på millioner af håndskrevne prøver og kan genkende de fleste håndskriftstile. Præcisionen afhænger dog af læseligheden. Pæn blokskrift genkendes bedre end hurtig kursiv.

Hvad er forskellen på OCR og en multimodal AI-model?

Traditionel OCR fokuserer udelukkende på at genkende og udtrække tekst. Multimodale AI-modeller som GPT-4o og Claude kan også forstå dokumentets kontekst, struktur og betydning. Du kan for eksempel bede en multimodal model om at “opsummere denne kontrakt” baseret på et billede. Den kombinerer OCR med sprogforståelse.

Er OCR gratis?

Der findes gratis OCR-løsninger som Tesseract (open source) og Google Lens. Cloud-baserede tjenester som Google Cloud Vision, Azure og AWS tilbyder gratis kvoter for lavt forbrug, men kræver betaling ved større mængder. Specialiserede virksomhedsløsninger som ABBYY er betalingsprodukter.


Relaterede termer