AI Ordbog
OCR (Optical Character Recognition)
Teknologi der genkender og udtrækker tekst fra billeder og dokumenter.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er OCR?
OCR (Optical Character Recognition) er en teknologi der genkender tekst i billeder og konverterer den til maskinlæsbar tekst. Når du tager et foto af en kvittering, scanner et dokument eller uploader en PDF, kan OCR automatisk udtrække al teksten, så den kan søges i, redigeres og behandles digitalt.
OCR har eksisteret i årtier, men moderne AI-drevet OCR er fundamentalt mere kraftfuld end traditionel OCR. Hvor ældre systemer krævede perfekt scannede dokumenter med standardskrifttyper, kan AI-baseret OCR håndtere håndskrift, skæve billeder, dårlig belysning og komplekse layouts med tabeller, kolonner og grafik.
Hvordan fungerer OCR?
Traditionel OCR
Klassisk OCR fungerer i tre trin:
- Forbehandling. Billedet renses: kontrast justeres, skævhed rettes, og støj fjernes
- Segmentering. Teksten opdeles i linjer, ord og individuelle tegn
- Genkendelse. Hvert tegn sammenlignes med kendte mønstre og identificeres
Denne tilgang virker godt på rene, scannede dokumenter med standardskrifttyper, men fejler ofte på fotos fra virkeligheden.
AI-drevet OCR
Moderne OCR bruger deep learning. Typisk convolutional neural networks (CNN) og transformer-arkitekturer. Det gør det muligt at genkende tekst direkte i billeder uden at skulle isolere individuelle tegn først:
- Feature extraction. Et neuralt netværk analyserer billedet og identificerer tekstregioner
- Sekvensgenkendelse. En recurrent eller transformer-baseret model læser hele ord og sætninger i kontekst
- Sprogmodellering. En sprogmodel korrigerer fejl baseret på kontekst (f.eks. at “rnaskinlæring” sandsynligvis skal være “maskinlæring”)
Denne tilgang giver markant bedre resultater, især på:
- Håndskrevet tekst
- Billeder taget med mobilkameraer
- Dokumenter med komplekse layouts
- Tekst på buede overflader eller i perspektiv
Multimodal OCR
De nyeste multimodale AI-modeller som GPT-4o, Claude og Gemini har OCR-kapabilitet indbygget. De kan ikke bare udtrække tekst, men også forstå dokumentets struktur, kontekst og betydning. Du kan uploade et billede af en faktura og bede modellen om at udtrække specifikke felter som beløb, dato og leverandørnavn.
Hvad bruges OCR til?
Dokumentdigitalisering
Den mest klassiske anvendelse: konvertering af fysiske dokumenter til søgbare, digitale formater. Virksomheder bruger OCR til at digitalisere arkiver med kontrakter, fakturaer, breve og rapporter. Biblioteker og museer bruger det til at gøre historiske dokumenter tilgængelige online.
Automatiseret dataindtastning
I stedet for manuelt at indtaste data fra fakturaer, formularer og kvitteringer, kan OCR automatisk udtrække relevant information:
- Bogføring. Udtrække beløb, momssatser og kontonumre fra fakturaer
- HR. Læse CV’er og ansøgninger automatisk
- Forsikring. Behandle skadeanmeldelser og dokumentation
- Sundhed. Digitalisere patientjournaler og recepter
ID-verifikation og KYC
Banker, fintechvirksomheder og offentlige tjenester bruger OCR til at læse pas, kørekort og ID-kort som del af Know Your Customer (KYC) processer. Når du tager et foto af dit kørekort i en bankapp, er det OCR der udtrækker dine oplysninger.
Tilgængelighed
OCR gør trykt tekst tilgængelig for synshandicappede ved at konvertere den til digital tekst, der kan læses op af en skærmlæser eller konverteres til punktskrift.
Nummerpladegenkendelse
Parkeringshuse, betalingsanlæg og politiets hastighedskontrol bruger specialiseret OCR til automatisk at aflæse nummerplader fra billeder og video.
Praktiske eksempler
Eksempel 1: Kvitteringsscanning
Du fotograferer en kvittering med din telefon. OCR-appen udtrækker automatisk butikkens navn, dato, individuelle vareposter med priser og det samlede beløb. Dataen eksporteres direkte til dit regnskabsprogram.
Eksempel 2: Dokumentsøgning
En advokatvirksomhed scanner 50.000 siders sagsmateriale. OCR konverterer alle sider til søgbar tekst, så juristerne kan finde relevante passager med en simpel tekstsøgning i stedet for at bladre manuelt.
Eksempel 3: Multimodal AI + OCR
Du uploader et foto af en håndskrevet opskrift til Claude og skriver: “Omskriv denne opskrift til en pæn digital version.” Modellen bruger OCR til at læse håndskriften og genererer en formateret opskrift med ingrediensliste og trinvise instruktioner.
Eksempel 4: Automatiseret fakturahåndtering
En virksomhed modtager 500 fakturaer om måneden. I stedet for manuel indtastning scanner et OCR-system alle fakturaer, udtrækker leverandør, beløb, forfaldsdato og fakturanummer, og opretter automatisk posteringer i økonomisystemet.
Kendte OCR-værktøjer og -tjenester
| Værktøj | Type | Styrke |
|---|---|---|
| Google Cloud Vision OCR | Cloud API | Stærk på mange sprog, god til fotos |
| Azure AI Document Intelligence | Cloud API | Specialiseret i strukturerede dokumenter (fakturaer, kvitteringer) |
| AWS Textract | Cloud API | God til tabeller og formularer |
| Tesseract | Open source | Gratis, fleksibel, 100+ sprog |
| GPT-4o / Claude / Gemini | Multimodal AI | Forstår kontekst og struktur, ikke kun tekst |
| ABBYY FineReader | Desktop/cloud | Industristandard for dokumentdigitalisering |
OCR-kvalitet og udfordringer
Hvad påvirker OCR-præcisionen?
- Billedkvalitet. Skarphed, belysning og opløsning har stor betydning
- Skrifttype og størrelse. Standardskrifttyper genkendes bedst. Dekorative skrifttyper og meget lille tekst er sværere
- Sprog. De fleste OCR-systemer er stærkest på engelsk. Danske specialtegn (æ, ø, å) kræver sprogunderstøttelse
- Layout-kompleksitet. Enkle tekstsider er nemmere end dokumenter med kolonner, tabeller og billeder blandet sammen
- Håndskrift. Stadig den sværeste kategori, selvom AI har gjort store fremskridt
Typiske fejl
- Forveksling af lignende tegn:
0vs.O,1vs.l,rnvs.m - Tab af formatering: tabeller der læses som ustruktureret tekst
- Forkert læserækkefølge i dokumenter med flere kolonner
- Problemer med specialtegn og diakritiske tegn
Sådan forbedrer du OCR-resultater
- Brug høj opløsning. Mindst 300 DPI for scannede dokumenter
- Sørg for god belysning. Undgå skygger og refleksioner ved fotografering
- Hold dokumentet plant. Minimér skævhed og bøjning
- Vælg det rigtige værktøj. Brug specialiserede løsninger til specifikke dokumenttyper
- Efterbehandl med AI. Brug en sprogmodel til at korrigere og strukturere OCR-output
Forskellen på OCR og image-to-text
OCR og image-to-text er beslægtede men forskellige teknologier:
- OCR udtrækker den tekst der allerede findes i billedet. Hvis billedet viser et skilt med “Åbent 9-17”, returnerer OCR netop den tekst.
- Image-to-text genererer nye tekstbeskrivelser af billedets visuelle indhold. For det samme billede ville image-to-text måske returnere: “Et hvidt skilt med sort tekst hænger i en butiksdør.”
Moderne multimodale modeller kan gøre begge dele samtidigt.
Ofte stillede spørgsmål
Hvad er OCR?
OCR (Optical Character Recognition) er en teknologi der automatisk genkender og udtrækker tekst fra billeder, scannede dokumenter og PDF-filer. Den konverterer trykt eller håndskrevet tekst til digital, maskinlæsbar tekst der kan søges i, redigeres og behandles.
Kan OCR læse håndskrift?
Ja, moderne AI-drevet OCR kan læse håndskrift med stigende præcision. Deep learning-modeller er trænet på millioner af håndskrevne prøver og kan genkende de fleste håndskriftstile. Præcisionen afhænger dog af læseligheden. Pæn blokskrift genkendes bedre end hurtig kursiv.
Hvad er forskellen på OCR og en multimodal AI-model?
Traditionel OCR fokuserer udelukkende på at genkende og udtrække tekst. Multimodale AI-modeller som GPT-4o og Claude kan også forstå dokumentets kontekst, struktur og betydning. Du kan for eksempel bede en multimodal model om at “opsummere denne kontrakt” baseret på et billede. Den kombinerer OCR med sprogforståelse.
Er OCR gratis?
Der findes gratis OCR-løsninger som Tesseract (open source) og Google Lens. Cloud-baserede tjenester som Google Cloud Vision, Azure og AWS tilbyder gratis kvoter for lavt forbrug, men kræver betaling ved større mængder. Specialiserede virksomhedsløsninger som ABBYY er betalingsprodukter.