Spring til indhold
AI Ordbog

AI Ordbog

Self-supervised learning

Maskinlæring hvor modellen skaber sine egne labels fra umærkede data.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er self-supervised learning?

Self-supervised learning er en form for maskinlæring hvor modellen skaber sine egne træningsmål fra umærkede data. I stedet for at mennesker manuelt mærker data med svar (som i supervised learning), designer man en opgave hvor svaret allerede er i dataen. Modellen skal bare finde det.

Det mest berømte eksempel er næste-token-forudsigelse, som bruges til at træne GPT, Claude og andre sprogmodeller. Opgaven er simpel: givet en sætning med det sidste ord fjernet, forudsig hvad der mangler. Svaret er allerede i teksten. Man behøver ikke at mærke noget manuelt. Man maskerer bare et ord og lader modellen gætte.

Self-supervised learning er den teknik der har gjort moderne AI mulig. Uden den ville det være umuligt at træne modeller på billioner af tokens. Der er simpelthen ikke nok mennesker til at mærke så meget data manuelt. Self-supervised learning løser dette ved at udnytte umærkede data direkte.

Yann LeCun, cheffen for AI-forskning hos Meta, kalder self-supervised learning for “den vigtigste idé i maskinlæring i de seneste årtier” og mener det er nøglen til fremtidige AI-gennembrud.

Hvordan fungerer self-supervised learning?

Idéen er at skabe en “pretext task” (en hjælpeopgave der kan løses automatisk fra dataene):

  1. Maskering. Skjul en del af inputtet og bed modellen forudsige det skjulte. BERT maskerer tilfældige ord i sætninger. MAE (Masked Autoencoders) maskerer dele af billeder.
  2. Næste element-forudsigelse. Forudsig hvad der kommer næst. GPT og Claude forudsiger det næste token i tekst. Videmodeller forudsiger det næste frame.
  3. Kontrastiv læring. Lær at genkende hvilke datapunkter der er “ens” og hvilke der er “forskellige”. CLIP (OpenAI) lærer at matche billeder med tekstbeskrivelser.
  4. Denoising. Tilføj støj til data og lad modellen genskabe det originale. Diffusion models bruger denne teknik.

Self-supervised learning i praksis

  1. GPT og Claude (causal language modeling). Tekst bruges som sit eget træningsmål. “Den danske hovedstad er [MASK]” → modellen lærer at svaret er “København.” Ingen menneskelig mærkning nødvendig. Svaret er allerede i teksten.
  2. BERT (masked language modeling). Maskerer 15% af ordene i en sætning og træner modellen til at forudsige dem baseret på konteksten fra begge sider.
  3. CLIP (kontrastiv læring). Lærer forbindelsen mellem billeder og tekst ved at matche billeder med deres beskrivelser. Bruges som komponent i Stable Diffusion og DALL-E.
  4. SimCLR og DINO (billedforståelse). Lærer billedrepræsentationer ved at lave to augmenterede versioner af samme billede og træne modellen til at genkende at de viser det samme.

Self-supervised vs. supervised vs. unsupervised

  1. Supervised learning. Mennesker mærker data. Dyrt, præcist, begrænset skala. “Her er et billede af en kat [mærket af et menneske].”
  2. Unsupervised learning. Ingen labels overhovedet. Modellen finder mønstre selv. Clustering, dimensionsreduktion.
  3. Self-supervised learning. Labels genereres automatisk fra dataen selv. Skalerbart som unsupervised, præcist som supervised. “Her er en sætning med ét ord fjernet, gæt hvilket.”

Nøglen til skala Self-supervised learning er grunden til at vi kan træne modeller på billioner af tokens. At mærke én million eksempler manuelt koster hundredtusindvis af dollars og tager måneder. Self-supervised learning kan generere milliarder af træningsmål gratis og øjeblikkeligt, direkte fra rå data. Det er denne skalerbarhed der har gjort store sprogmodeller mulige.


FAQ

Hvad er self-supervised learning?

Self-supervised learning er en maskinlæringsteknik hvor modellen automatisk skaber sine egne træningsmål fra umærkede data. Det bruges til at præ-træne sprogmodeller som GPT og Claude ved at lade modellen forudsige maskerede eller næste tokens i tekst, uden behov for menneskelig mærkning af data.

Hvad er forskellen på self-supervised og unsupervised learning?

Begge bruger umærkede data, men de løser forskellige typer opgaver. Unsupervised learning finder mønstre i data (clustering, dimensionsreduktion). Self-supervised learning genererer sine egne labels og løser en forudsigelsesopgave. Det er teknisk set en form for supervised learning, bare med automatisk genererede labels.

Hvorfor er self-supervised learning vigtigt?

Fordi det gør det muligt at træne AI-modeller på enorme mængder umærkede data. Manuelt at mærke data er dyrt og langsomt. Self-supervised learning genererer træningsmål automatisk, hvilket er nøglen til at træne modeller med hundredvis af milliarder parametre på billioner af tokens.


Relaterede termer