AI Ordbog
Loss function
Den matematiske funktion der måler hvor forkert en AI-models forudsigelser er.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er en loss function?
En loss function er et mål for hvor forkert en AI-model er. Den tager modellens forudsigelse og det korrekte svar og returnerer ét tal: fejlen. Jo højere tallet er, jo mere forkert er modellen. Jo lavere, jo bedre.
Tænk på det som en karakter til en eksamen. Men omvendt. En loss på 0 er perfekt (ingen fejl). En loss på 10 er dårlig (stor fejl). Hele formålet med træning er at reducere dette tal. Gradient descent og backpropagation arbejder sammen om at skubbe loss nedad, skridt for skridt, over millioner af træningseksempler.
Loss function er afgørende fordi den definerer hvad modellen optimerer for. Vælger du den forkerte loss function, lærer modellen det forkerte. Det er som at give en elev en eksamen i det forkerte fag. De lærer flittigt men det forkerte.
Hvorfor er loss function vigtigt?
- Den definerer målet. Loss function fortæller modellen præcis hvad “bedre” betyder. Uden den er der ingen retning for gradient descent. Ingen måde at vide om ændringer er forbedringer.
- Den styrer hvad modellen lærer. Forskellige loss functions prioriterer forskellige ting. En loss function der straffer store fejl hårdt giver en mere konservativ model. En der behandler alle fejl ens giver en mere balanceret model.
- Den muliggør træning. Backpropagation kræver en differentiérbar loss function for at beregne gradienter. Uden loss function, ingen gradienter. Uden gradienter, ingen læring.
- Den påvirker modellens adfærd. RLHF (Reinforcement Learning from Human Feedback) ændrer loss function for at inkludere menneskelig præference. Det er det der gør ChatGPT hjælpsom i stedet for blot at forudsige sandsynlige tekster.
De vigtigste loss functions
Cross-entropy loss
Den vigtigste loss function i moderne AI. Brugt til næsten alle sprogmodeller og klassifikationsopgaver.
Hvad den måler: Forskellen mellem modellens sandsynlighedsfordeling og den korrekte fordeling.
Eksempel (sprogmodel):
- Modellen skal forudsige næste ord efter “Hovedstaden i Danmark er.”
- Korrekt svar: “København” (sandsynlighed 1.0).
- Modellen siger: “København” 0.7, “Aarhus” 0.2, “Odense” 0.1.
- Cross-entropy loss: -log(0.7) = 0.36.
- Hvis modellen havde sagt “København” 0.99: -log(0.99) = 0.01 (meget lavere loss. Bedre).
- Hvis modellen havde sagt “København” 0.01: -log(0.01) = 4.61 (meget høj loss. Dårlig).
Intuition: Cross-entropy straffer modellen hårdt for at være sikker på det forkerte. Hvis modellen siger 99% til det forkerte svar, er straffen enorm. Hvis den siger 70% til det rigtige svar, er straffen moderat. Den var på rette spor men ikke sikker nok.
Bruges til: Sprogmodeller (GPT, Claude, Gemini), billedklassifikation, sentiment-analyse. Enhver opgave hvor modellen vælger mellem kategorier.
Mean Squared Error (MSE)
Den klassiske loss function for opgaver med numeriske forudsigelser.
Hvad den måler: Gennemsnittet af kvadrerede forskelle mellem forudsigelser og korrekte værdier.
Eksempel (prisforudsigelse):
- Model forudsiger boligpriser: [2.1M, 1.5M, 3.2M].
- Korrekte priser: [2.0M, 1.8M, 3.0M].
- Fejl: [0.1M, -0.3M, 0.2M].
- Kvadrerede fejl: [0.01, 0.09, 0.04].
- MSE: (0.01 + 0.09 + 0.04) / 3 = 0.047.
Intuition: Kvadreringen gør at store fejl straffes uforholdsmæssigt hårdt. En fejl på 0.3 giver 0.09, men en fejl på 0.6 giver 0.36. Fire gange så stor straf for dobbelt fejl. Det tvinger modellen til at undgå store fejl.
Bruges til: Regression (forudsig et tal), prisforudsigelse, vejrmodeller, enhver opgave med kontinuerte numeriske output.
Mean Absolute Error (MAE)
Alternativ til MSE der er mere robust over for outliers.
Hvad den måler: Gennemsnittet af absolutte forskelle.
Forskel fra MSE: MAE straffer alle fejl proportionelt. MSE straffer store fejl ekstra hårdt. Hvis dine data har outliers (ekstreme værdier), kan MAE give en bedre model fordi den ikke overreagerer på enkeltstående extreme fejl.
Binary Cross-Entropy
Til binær klassifikation: ja/nej, spam/ikke-spam, positiv/negativ.
Eksempel (spam-detektion):
- Email er spam (korrekt: 1.0).
- Modellen siger: 0.8 sandsynlighed for spam.
- Loss: -log(0.8) = 0.22.
- Hvis modellen havde sagt 0.1: -log(0.1) = 2.30 (meget højere. Stor fejl).
Contrastive Loss
Til at lære embeddings. Bruges i modeller som CLIP og sentence embeddings.
Hvad den måler: Om lignende ting har tætte embeddings og forskellige ting har fjerne embeddings.
Eksempel: Et billede af en hund og teksten “en hund” bør have tætte embeddings. Et billede af en hund og teksten “en bil” bør have fjerne embeddings. Contrastive loss straffer modellen når lignende par er for langt fra hinanden eller forskellige par er for tæt på.
Triplet Loss
Relateret til contrastive loss men bruger tre elementer:
- Anchor. Et referenceelement (et billede af person A).
- Positive. Et lignende element (et andet billede af person A).
- Negative. Et forskelligt element (et billede af person B).
Loss straffer modellen hvis afstanden anchor-positive er større end afstanden anchor-negative. Bruges i ansigtsgenkendelse og lignende.
Loss function i sprogmodeller
Pre-training loss
Under pre-training bruger sprogmodeller next-token prediction med cross-entropy loss:
- Model læser: “Den store hund løb hen over.”
- Model skal forudsige: “vejen” (eller hvad der følger i træningsdataen).
- Cross-entropy loss beregnes mellem modellens sandsynlighedsfordeling og det korrekte token.
- Gennemsnittet af loss over alle tokens i alle træningseksempler er modellens samlede trænings-loss.
Perplexity
Perplexity er en populær metrik for sprogmodeller der er direkte afledt af cross-entropy loss:
perplexity = 2^(cross-entropy loss)
- Perplexity 1: perfekt model (forudsiger altid det korrekte token med 100% sikkerhed).
- Perplexity 10: modellen er i gennemsnit lige så usikker som om den skulle vælge mellem 10 lige sandsynlige ord.
- Perplexity 100: modellen er meget usikker. Som at vælge mellem 100 ord.
Lavere perplexity = bedre sprogmodel.
RLHF loss
Efter pre-training justeres sprogmodeller med RLHF:
- En reward model trænes til at give højere score til svar mennesker foretrækker.
- Loss function ændres fra “forudsig det mest sandsynlige næste token” til “generér svar der scorer højt hos reward modellen.”
- Denne ændring i loss function er det der gør en rå tekstforudsiger til en hjælpsom assistent.
Loss landscape
Loss function definerer et “landskab” i parameterrummet:
- Højden repræsenterer loss-værdien for en given kombination af parametre.
- Dale er områder med lav loss. Gode modeller.
- Bakker er områder med høj loss. Dårlige modeller.
- Gradient descent bevæger sig nedad i dette landskab.
For en model med milliarder af parametre er dette landskab i et rum med milliarder af dimensioner. Umuligt at visualisere men matematisk veldefineret.
Valg af loss function
Valget af loss function afhænger af opgaven:
| Opgave | Loss function |
|---|---|
| Sprogmodel (næste token) | Cross-entropy |
| Binær klassifikation (ja/nej) | Binary cross-entropy |
| Multi-klasse klassifikation | Categorical cross-entropy |
| Regression (forudsig tal) | MSE eller MAE |
| Embedding-læring | Contrastive eller triplet loss |
| Billedgenerering (GAN) | Adversarial loss |
| RLHF-alignment | Reward-baseret loss |
Loss i praksis
Træningskurver
Under træning plottes loss over tid:
- Loss falder hurtigt i starten. Modellen lærer de mest grundlæggende mønstre.
- Loss flader ud efterhånden. De resterende forbedringer er mindre og kræver mere data.
- Trænings-loss vs. validerings-loss. Hvis trænings-loss falder men validerings-loss stiger, overfitter modellen.
Hvornår er loss “godt nok”?
- Det afhænger af opgaven. En cross-entropy loss på 2.0 for en sprogmodel er dårlig. For en model med 100.000 mulige tokens kan 3.0 være acceptabelt i starten.
- Sammenligning. Loss er mest meningsfuld relativt. Er denne models loss lavere end den forrige version?
- Downstream evaluering. Ultimativt er det downstream-performance (kvaliteten af modellens svar, nøjagtigheden af klassifikation) der tæller. Ikke loss-tallet i sig selv.
Loss function er AIs definition af fejl Hvad en model lærer styres af hvad den straffes for. En model der straffes for at forudsige det forkerte næste ord bliver en sprogmodel. En model der straffes for at generere svar mennesker ikke bryder sig om bliver en hjælpsom assistent. En model der straffes for at klassificere billeder forkert bliver en billedgenkender. Loss function er den usynlige hånd der former modellens adfærd. Vælg den rigtigt, og modellen lærer præcis det du ønsker.
FAQ
Hvad er en loss function?
En loss function (tabsfunktion) er en matematisk funktion der måler hvor forkert en AI-models forudsigelser er sammenlignet med de korrekte svar. Den returnerer ét tal. Jo højere, jo større fejl. Hele formålet med træning er at minimere dette tal via gradient descent og backpropagation.
Hvad er cross-entropy loss?
Cross-entropy loss er den mest brugte loss function i AI. Den måler forskellen mellem modellens sandsynlighedsfordeling og den korrekte fordeling. Den straffer modellen hårdt for at være sikker på det forkerte svar og bruges til sprogmodeller, klassifikation og næsten alle opgaver hvor modellen vælger mellem kategorier.
Hvad er forskellen på loss function og accuracy?
Loss function er det tal modellen optimerer under træning. Et kontinuert mål for fejl. Accuracy er andelen af korrekte svar. Et diskret mål der er lettere at forstå men ikke direkte optimerbart. En model kan have lav loss men moderat accuracy (den er tæt på men rammer ikke altid præcist) eller omvendt.
Kan man bruge forskellige loss functions til den samme model?
Ja. Mange modeller bruger kombinerede loss functions. F.eks. en sprogmodel der optimerer for både next-token prediction (cross-entropy) og menneskelig præference (RLHF reward). Kombinationen af loss functions styrer den samlede balance af hvad modellen lærer.