AI Ordbog
Supervised learning
Maskinlæring hvor modellen trænes med data der har kendte svar.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er supervised learning?
Supervised learning (overvåget læring på dansk) er den mest udbredte form for maskinlæring. Modellen trænes på data hvor det korrekte svar er kendt på forhånd. Det er som at lære ved hjælp af en facitliste: for hvert eksempel ved modellen hvad svaret burde være, og den justerer sig selv for at komme tættere på det rigtige svar.
Navnet “supervised” (overvåget) refererer til at modellen har en “supervisor”: de mærkede data der fortæller den hvad der er rigtigt og forkert. Modellen får eksempler som “dette billede er en kat”, “denne email er spam” eller “denne bolig koster 3,2 millioner” og lærer sammenhængene.
Det er supervised learning du bruger når du træner et spamfilter, bygger en prisforudsigelse, eller finjusterer en sprogmodel på specifikke eksempler. Langt det meste maskinlæring i produktionssystemer er supervised learning.
Hvordan fungerer supervised learning?
Processen følger en klar struktur:
- Mærkede data. Man starter med et datasæt hvor hvert eksempel har et input og et kendt output (label). For billedgenkendelse: tusindvis af billeder, hvert mærket med hvad der er på billedet. For spam-detection: tusindvis af emails, hver mærket som “spam” eller “ikke spam”.
- Træning. Modellen ser eksemplerne, giver sit gæt og sammenligner med det korrekte svar. Fejlen beregnes med en loss function, og modellens parametre justeres for at reducere fejlen. Denne proces gentages tusindvis eller millionvis af gange.
- Validering. Modellen testes på data den ikke har set under træning for at sikre at den generaliserer: at den har lært de underliggende mønstre i stedet for bare at huske træningseksemplerne.
- Forudsigelse. Den trænede model bruges på nye, usete data. Spamfilteret vurderer nye emails. Prismodellen estimerer nye boliger.
De to hovedtyper
Supervised learning deles i to kategorier baseret på outputtypen:
- Klassifikation. Outputtet er en kategori. “Er dette billede en kat eller en hund?” “Er denne email spam eller ej?” “Har patienten diabetes?” Modellen vælger mellem foruddefinerede klasser.
- Regression. Outputtet er et tal. “Hvad vil denne bolig koste?” “Hvor mange varer sælger vi næste måned?” “Hvad er patientens blodtryk om en uge?” Modellen forudsiger en kontinuerlig værdi.
Populære algoritmer
- Lineær regression. Den simpleste regression-model. Finder den rette linje der bedst beskriver sammenhængen mellem input og output. God til simple, lineære sammenhænge.
- Logistisk regression. Trods navnet er det en klassifikationsalgoritme. Beregner sandsynligheden for at et eksempel tilhører en bestemt klasse. Simpel, fortolkelig og stadig bredt brugt.
- Decision trees og Random Forests. Træffer beslutninger via en serie ja/nej-spørgsmål. Random Forests kombinerer mange træer for bedre resultater. Populære fordi de er lette at forstå og forklare.
- Support Vector Machines (SVM). Finder den optimale grænse mellem klasser. Effektive på mindre datasæt og i høje dimensioner.
- Neurale netværk og deep learning. Den mest kraftfulde tilgang for store, komplekse datasæt. CNN’er til billeder, transformers til tekst. Kræver mest data og beregningskraft men giver typisk de bedste resultater.
Supervised learning i praksis
- Spamfiltrering. Gmail og Outlook bruger supervised learning til at klassificere emails som spam eller ej, trænet på millioner af mærkede emails.
- Medicinsk diagnostik. Modeller trænet på røntgenbilleder mærket af radiologer kan identificere kræft, frakturer og andre tilstande.
- Prisforudsigelse. Boligpriser, aktiekurser og produktefterspørgsel forudsiges baseret på historiske data med kendte priser.
- Ansigtsgenkendelse. iPhone’s Face ID er trænet supervised på millioner af ansigter med kendte identiteter.
- Oversættelse. Neurale oversættelsesmodeller er trænet på millioner af sætningspar: en sætning på ét sprog parret med dens oversættelse.
Supervisions paradoks Jo bedre supervised learning-systemer vi bygger, jo mere mærkede data har vi brug for, og mærkning er dyrt og tidskrævende. Et datasæt med 10 millioner billeder kræver at nogen manuelt har mærket hvert enkelt. Det er en af grundene til at self-supervised learning (som bruges i LLM’er) og unsupervised learning er blevet så vigtige: de kræver ikke mærkede data.
Begrænsninger
- Kræver mærkede data. Den største begrænsning. Mærkning er tidskrævende, dyrt og kræver ofte domæneeksperter. Et medicinsk datasæt kræver at læger mærker hvert billede.
- Bias i labels. Hvis de mærkede data er biased, arver modellen denne bias. Et ansættelses-scoringssystem trænet på historiske beslutninger kan videreføre diskrimination.
- Overfitting. Modellen kan lære træningsdataene udenad i stedet for at lære de generelle mønstre. Den præsterer perfekt på træningsdata men dårligt på nye data.
- Stationaritet. Modellen antager at fremtiden ligner fortiden. Hvis verden ændrer sig (nye typer spam, ændret kundeopførsel), skal modellen gen-trænes.
FAQ
Hvad er supervised learning?
Supervised learning (overvåget læring) er en type maskinlæring hvor modellen trænes på data med kendte svar. Den lærer sammenhængen mellem input og output fra mærkede eksempler og kan derefter forudsige output for nye data. Det er den mest udbredte form for maskinlæring.
Hvad er forskellen på supervised og unsupervised learning?
Supervised learning bruger mærkede data med kendte svar (f.eks. emails mærket som spam/ikke-spam). Unsupervised learning bruger umærkede data og finder selv mønstre og strukturer (f.eks. kundesegmentering). Supervised learning kræver mere forberedelse men giver typisk mere præcise resultater for specifikke opgaver.
Hvad er eksempler på supervised learning?
Spamfiltre (klassificerer emails), ansigtsgenkendelse (identificerer personer), medicinsk diagnostik (finder sygdomme i billeder), prisforudsigelse (estimerer boligpriser) og maskinoversættelse (oversætter mellem sprog) er alle supervised learning.
Hvorfor er mærkede data så vigtige?
Uden mærkede data har modellen ingen facitliste at lære fra. Mærkede data fortæller modellen hvad der er rigtigt og forkert, så den kan justere sig selv. Kvaliteten og mængden af mærkede data er ofte den vigtigste faktor for hvor god den endelige model bliver.