AI Ordbog
Computer Vision
AI-teknologi der gør computere i stand til at se og forstå billeder og video.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er Computer Vision?
Computer Vision (computersyn på dansk) er den gren af kunstig intelligens der gør computere i stand til at “se” og forstå billeder og video. Ligesom NLP handler om at få computere til at forstå sprog, handler computer vision om at få dem til at forstå visuel information.
Når din telefon genkender dit ansigt, Google Photos finder alle billeder med din hund, et røntgensystem opdager en tumor, eller en selvkørende bil ser en fodgænger, er det computer vision i arbejde.
Feltet har eksisteret siden 1960’erne, men det er først med deep learning og især convolutional neural networks (CNN’er) fra omkring 2012 at computer vision er blevet rigtig brugbart. Det afgørende øjeblik var AlexNet i 2012, der vandt ImageNet-konkurrencen med en fejlrate der var næsten halveret sammenlignet med tidligere metoder. Udelukkende ved brug af deep learning.
I dag er computer vision overalt. Det bruges i industrien, sundhedsvæsenet, sikkerhed, transport, landbrug, detailhandel og underholdning. Og med multimodale AI-modeller som GPT og Gemini er computer vision nu integreret direkte i sprogmodeller.
Hvordan fungerer Computer Vision?
Den grundlæggende proces involverer at konvertere pixels til forståelse:
- Billedindlæsning. Et billede er for en computer bare et gitter af tal. Hver pixel har værdier for rød, grøn og blå (RGB). Et billede på 1000x1000 pixels er tre millioner tal.
- Feature-ekstraktion. Modellen identificerer vigtige features i billedet: kanter, hjørner, teksturer og former. I et CNN sker dette automatisk: de første lag finder simple kanter, dybere lag finder mere komplekse mønstre som øjne, hjul eller bogstaver.
- Repræsentation. De ekstraherede features kombineres til en repræsentation af billedets indhold: en komprimeret matematisk beskrivelse af hvad der er på billedet.
- Fortolkning. Repræsentationen bruges til at give et svar: “dette er en kat”, “der er tre personer i billedet”, “tumoren sidder i venstre lunge”.
Hovedopgaver inden for Computer Vision
- Billedklassifikation. Hvad viser billedet? “Kat”, “hund”, “bil”. Det mest grundlæggende problem i computer vision.
- Objektdetektering. Hvor i billedet er objekterne? Tegner en boks rundt om hver genkendt genstand. Bruges i selvkørende biler, sikkerhedskameraer og industriel kvalitetskontrol.
- Billedsegmentering. Hvilke pixels tilhører hvilket objekt? Mere præcist end objektdetektering: hvert enkelt pixel tildeles en kategori. Bruges i medicinsk billedanalyse og augmented reality.
- Ansigts-genkendelse. Identifikation af personer ud fra deres ansigt. Bruges til at låse telefoner op, til sikkerhed i lufthavne og (kontroversielt) til overvågning.
- Positionsestimering. Bestemmelse af kroppens position og bevægelse. Bruges i sportsteknologi, fysioterapi og motion capture til film og spil.
- Optisk tegngenkendelse (OCR). Konvertering af tekst i billeder til digital tekst. Bruges til at scanne dokumenter, læse nummerplader og digitalisere bøger.
- Billedgenerering. Skabelse af nye billeder fra tekst eller andre billeder. Midjourney, DALL-E og Stable Diffusion er alle computer vision-systemer.
Computer Vision i praksis
- Sundhed. AI-systemer kan analysere røntgenbilleder, MR-scanninger og hudlæsioner med en præcision der matcher (og i nogle tilfælde overgår) erfarne specialister. De bruges som støtteværktøj i diagnostik af kræft, øjensygdomme og brud.
- Selvkørende biler. Tesla, Waymo og andre bruger computer vision til at genkende andre biler, fodgængere, skilte, vejstriber og forhindringer i realtid. Systemet skal træffe beslutninger på millisekunder.
- Landbrug. Droner udstyret med computer vision kan overvåge afgrøder, identificere sygdomme, estimere udbytte og detektere ukrudt. Opgaver der tidligere krævede manuel inspektion af enorme arealer.
- Kvalitetskontrol. I produktionen inspicerer computer vision-systemer produkter for fejl hurtigere og mere konsistent end mennesker. De kan finde ridser, fejlfarver og forkerte dimensioner med høj præcision.
- Detailhandel. Computer vision bruges til at tracke hvilke varer kunder tager fra hylderne (som i Amazons nu lukkede Go-butikker), til lagerstyring og til butikslayout-optimering.
Mennesker vs. computere Mennesker er stadig bedre end computere til mange visuelle opgaver. Vi forstår kontekst, kan genkende objekter i usædvanlige situationer, og vi lader os ikke narre af adversarial eksempler (billeder designet til at snyde AI). Men computere er bedre til konsistens, hastighed og udholdenhed. En AI kan analysere tusindvis af røntgenbilleder uden at blive træt, distraheret eller påvirket af bias.
Vigtige arkitekturer
- CNN (Convolutional Neural Networks). Den klassiske arkitektur for computer vision. Bruger filtre der glider hen over billedet for at fange lokale mønstre. AlexNet, VGG, ResNet og EfficientNet er alle CNN’er.
- Vision Transformers (ViT). Anvender transformer-arkitekturen (fra NLP) på billeder ved at opdele dem i patches. Har vist sig konkurrencedygtige med og ofte bedre end CNN’er, især på store datasæt.
- Diffusion models. Bruges til billedgenerering. Lærer at fjerne støj fra billeder trin for trin og kan dermed generere nye billeder fra ren støj. Midjourney og Stable Diffusion bruger denne teknik.
FAQ
Hvad er Computer Vision?
Computer Vision er den gren af kunstig intelligens der gør computere i stand til at se og forstå billeder og video. Det bruges i ansigts-genkendelse, selvkørende biler, medicinsk diagnostik, kvalitetskontrol og billedgenerering. Teknologien er baseret på deep learning og neurale netværk.
Hvordan fungerer Computer Vision?
Et billede er for computeren bare et gitter af tal (pixels). Computer vision-modeller (typisk CNN'er eller Vision Transformers) analyserer disse tal og identificerer mønstre: først simple kanter og former, derefter mere komplekse objekter. Modellen er trænet på millioner af eksempler og lærer at genkende mønstre den har set før.
Hvad er forskellen på Computer Vision og billedgenkendelse?
Billedgenkendelse er en specifik opgave inden for computer vision: at klassificere hvad et billede viser. Computer vision er det bredere felt der også omfatter objektdetektering, segmentering, positionsestimering, OCR og billedgenerering. Billedgenkendelse er en del af computer vision.
Bruges Computer Vision i hverdagen?
Ja, konstant. Når du låser din telefon op med dit ansigt, når Google Photos genkender personer, når din bil har automatisk nødbremsning, når du scanner et dokument med din telefon, eller når du bruger et AR-filter på Instagram. Alt dette er computer vision.