Spring til indhold
AI Ordbog

AI Ordbog

Unsupervised learning

Maskinlæring hvor modellen selv finder mønstre i umærkede data.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er unsupervised learning?

Unsupervised learning (uovervåget læring på dansk) er en type maskinlæring hvor modellen får data uden mærkede svar og selv skal finde mønstre og strukturer. Der er ingen facitliste. Modellen skal selv opdage hvad der er interessant i dataene.

Tænk på forskellen mellem supervised og unsupervised learning som forskellen mellem at lære med en lærer og at lære selv. Med supervised learning siger læreren “dette er en kat, dette er en hund.” Med unsupervised learning får du hundredvis af billeder og skal selv finde ud af at der er to grupper der ligner hinanden.

Unsupervised learning er særligt værdifuld fordi de fleste data i verden er umærkede. Det er dyrt og tidskrævende at mærke data manuelt, men der findes enorme mængder rå, ustrukturerede data. Unsupervised learning kan udnytte disse data direkte.

Hovedopgaver

  1. Clustering (gruppering). Find naturlige grupper i data. Kundesegmentering er det klassiske eksempel: givet tusindvis af kunders købshistorik, find grupper af lignende kunder. K-means og DBSCAN er populære clustering-algoritmer.
  2. Dimensionsreduktion. Reducer antallet af variable i data mens de vigtigste mønstre bevares. PCA (Principal Component Analysis) og t-SNE er klassiske metoder, autoencoders er den deep learning-baserede tilgang. Bruges til visualisering og som forbehandling for andre modeller.
  3. Anomali-detection. Find datapunkter der skiller sig ud fra mængden. Hvis modellen har lært hvad “normal” data ser ud, kan den identificere usædvanlige observationer: potentiel svindel, defekte produkter eller cyberangreb.
  4. Associationsanalyse. Find sammenhænge mellem elementer. “Kunder der køber brød, køber ofte smør”. Det er associationsanalyse. Bruges i anbefalingssystemer og markedsanalyse.
  5. Density estimation. Estimér den underliggende sandsynlighedsfordeling i data. Bruges til at forstå dataens struktur og som grundlag for generative modeller.

Populære algoritmer

  1. K-means. Den mest kendte clustering-algoritme. Opdeler data i K grupper ved at minimere afstanden inden for hver gruppe. Simpel og effektiv, men kræver at man specificerer antal grupper på forhånd.
  2. Hierarkisk clustering. Bygger et træ af klynger fra individuelle datapunkter til én stor klynge (eller omvendt). Giver et mere nuanceret billede end K-means og kræver ikke at man angiver antal grupper.
  3. DBSCAN. Finder klynger baseret på datapunkters tæthed. Kan finde vilkårligt formede klynger og identificerer automatisk outliers. God til data hvor klyngerne ikke er kugleformede.
  4. PCA. Finder de vigtigste retninger (komponenter) i data og projicerer data ned i færre dimensioner. Den mest brugte dimensionsreduktionsteknik.
  5. Autoencoders. Neurale netværk der lærer komprimerede repræsentationer af data. Kan fange ikke-lineære mønstre som PCA ikke kan.

Unsupervised learning i praksis

  1. Kundesegmentering. E-commerce og banker bruger clustering til at gruppere kunder baseret på adfærd: hvad de køber, hvornår de køber og hvor meget de bruger. Hver gruppe kan derefter målrettes med tilpassede tilbud.
  2. Anomali-detection i finans. Kreditkortsvindel detekteres ved at finde transaktioner der afviger fra kundens normale mønster. Modellen lærer hvad “normal” opførsel er og flager afvigelser.
  3. Billedkomprimering. Autoencoders kan lære at komprimere billeder til kompakte repræsentationer, hvilket sparer lagerplads og båndbredde.
  4. Markedsanalyse. Hvilke produkter købes ofte sammen? Associationsanalyse hjælper butikker med at placere produkter strategisk og skabe bundtilbud.
  5. Genforsknings-data. Clustering bruges til at gruppere gener med lignende ekspressionsmønstre, hvilket hjælper forskere med at identificere biologiske processer og sygdomsmekanismer.

Self-supervised learning: det bedste af to verdener Moderne sprogmodeller som GPT og Claude bruger en teknik kaldet self-supervised learning, der er en hybrid. Modellen træner på umærkede data (tekst fra internettet), men skaber sine egne labels automatisk, f.eks. ved at maskere et ord og forsøge at forudsige det. Det kombinerer unsupervised learnings evne til at bruge enorme mængder umærkede data med supervised learnings evne til at lære fra specifikke eksempler.

Begrænsninger

  1. Svær at evaluere. Uden kendte svar er det svært at vurdere om modellen har fundet meningsfulde mønstre. Er tre kundesegmenter bedre end fem? Der er ikke altid et objektivt svar.
  2. Kræver domæneviden. Resultaterne skal fortolkes af en person med domæneviden. Modellen finder mønstre, men mennesker skal afgøre om mønstrene er relevante og handlingsbare.
  3. Følsom over for parametre. Mange algoritmer kræver valg af hyperparametre (antal klynger, afstandsmål) der markant påvirker resultaterne. Forkerte valg giver meningsløse resultater.

FAQ

Hvad er unsupervised learning?

Unsupervised learning (uovervåget læring) er en type maskinlæring hvor modellen finder mønstre og strukturer i data uden mærkede svar. I stedet for at have en facitliste opdager modellen selv grupperinger, sammenhænge og anomalier i dataene.

Hvad er forskellen på supervised og unsupervised learning?

Supervised learning bruger mærkede data med kendte svar og lærer at forudsige output. Unsupervised learning bruger umærkede data og finder selv mønstre. Supervised learning er bedst til specifikke forudsigelsesopgaver, unsupervised learning til udforskning og mønsteropdagelse.

Hvad er clustering?

Clustering er den mest brugte unsupervised learning-teknik. Den grupperer datapunkter baseret på lighed, så punkter i samme klynge ligner hinanden mere end punkter i andre klynger. Det bruges bl.a. til kundesegmentering, dokumentgruppering og billedanalyse.

Hvor bruges unsupervised learning?

Kundesegmentering, svindeldetektion, anbefalingssystemer, datakomprimering, markedsanalyse og biologisk forskning er alle områder hvor unsupervised learning bruges i praksis. Det er særligt værdifuldt i situationer med store mængder umærkede data.


Relaterede termer