AI Ordbog
Gradient descent
Optimeringsalgoritmen der justerer en AI-models parametre skridt for skridt for at minimere fejl.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er gradient descent?
Gradient descent er den algoritme der får AI-modeller til at blive bedre. Den tager de gradienter som backpropagation beregner og bruger dem til faktisk at opdatere modellens parametre, skridt for skridt, i den retning der reducerer fejlen.
Forestil dig at du står på en bjergside i tæt tåge og vil ned til dalen. Du kan ikke se dalen, men du kan mærke hvilken retning der går nedad under dine fødder. Gradient descent er strategien: tag et skridt i den retning der går mest nedad. Gentag. Til sidst når du bunden.
I AI er “bjerget” fejllandskabet (loss landscape). Et højdimensionelt rum hvor højden repræsenterer modellens fejl. “Dalen” er det punkt hvor fejlen er lavest. Den bedst mulige model. Gradient descent navigerer dette landskab ved at følge hældningen nedad.
Hvordan fungerer det?
Den grundlæggende cyklus
- Beregn fejlen. Kør modellen på træningsdata og mål hvor forkert den er via en loss function.
- Beregn gradienter. Backpropagation beregner gradienten: den retning og størrelse fejlen ændres med for hver parameter.
- Opdater parametre. Justér hver parameter i den modsatte retning af gradienten (nedad mod lavere fejl).
- Gentag. Kør trinene igen med nye data. Hver iteration reducerer fejlen lidt.
Opdateringsreglen
For hver parameter w i modellen:
w_ny = w_gammel - learning_rate × gradient
- w_gammel: parametrens nuværende værdi.
- gradient: retningen fejlen stiger (beregnet af backpropagation).
- learning_rate: hvor stort et skridt der tages (en hyperparameter du vælger).
- w_ny: parametrens opdaterede værdi.
Minustegnet er afgørende: gradienten peger mod stigende fejl, så vi trækker den fra for at gå mod faldende fejl.
Learning rate: skridtets størrelse
Learning rate er den vigtigste hyperparameter i gradient descent. Den bestemmer hvor store skridt modellen tager:
For høj learning rate
- Store skridt der overskrider dalen.
- Modellen bouncer frem og tilbage og konvergerer aldrig.
- I værste fald eksploderer fejlen. Træningen divergerer.
For lav learning rate
- Bittesmå skridt der tager ekstremt lang tid.
- Risiko for at sidde fast i et lokalt minimum (en lille dal der ikke er den dybeste).
- Spild af GPU-tid og penge.
Den rette learning rate
- Store nok skridt til at gøre fremskridt.
- Små nok til at konvergere stabilt.
- Typisk et tal mellem 0.0001 og 0.01 for deep learning.
- Ofte reduceres learning rate undervejs i træningen (learning rate scheduling).
Varianter af gradient descent
Batch Gradient Descent
- Hvad. Beregn gradienter over hele træningsdatasættet før hver opdatering.
- Fordel. Stabil, præcis gradient.
- Ulempe. Ekstremt langsom for store datasæt. Millioner af eksempler skal processeres for ét skridt.
- Bruges. Sjældent i moderne deep learning på grund af hastighed.
Stochastic Gradient Descent (SGD)
- Hvad. Beregn gradienten for ét enkelt træningseksempel og opdater straks.
- Fordel. Hurtig. Hvert eksempel giver en opdatering.
- Ulempe. Meget støjende gradienter. Hvert enkelt eksempel giver en upræcis retning. Modellen zigzagger mod målet.
- Bruges. Sjældent i ren form, men er grundlaget for mini-batch varianten.
Mini-batch Gradient Descent
- Hvad. Beregn gradienter over en lille batch af træningseksempler (typisk 32-4096 eksempler) og opdater.
- Fordel. Balancerer stabilitet (batch) og hastighed (stochastic). Udnytter GPU-parallelisme effektivt.
- Ulempe. Batch size er en hyperparameter der skal vælges.
- Bruges. Standarden i moderne deep learning. Når folk siger “SGD” mener de næsten altid mini-batch SGD.
Moderne optimerere
Ren gradient descent er sjældent nok. Moderne optimerere bygger på gradient descent men tilføjer smarte forbedringer:
SGD med momentum
- Idé. Tilføj “inerti” til opdateringerne. Ligesom en kugle der ruller ned ad en bakke akkumulerer fart, akkumulerer momentum retningen fra tidligere gradienter.
- Effekt. Hurtigere konvergens. Mindre zigzagging. Bedre til at passere lokale minima.
- Analogi. I stedet for at stoppe og mærke hældningen ved hvert skridt, ruller du og lader farten bære dig forbi små bump.
Adam (Adaptive Moment Estimation)
- Idé. Tilpas learning rate individuelt for hver parameter baseret på historiske gradienter. Parametre med store, konsistente gradienter får lavere learning rate. Parametre med små, sporadiske gradienter får højere.
- Effekt. Kræver mindre tuning af learning rate. Konvergerer hurtigt. Robust over for forskellige problemer.
- Bruges. Den mest populære optimizer i deep learning. Standard i de fleste frameworks.
AdamW
- Idé. Adam med korrekt weight decay (regularisering der forhindrer parametre i at blive for store).
- Bruges. Standarden for træning af store sprogmodeller. GPT, Claude og de fleste moderne modeller trænes med AdamW.
Andre varianter
- Adagrad. Tilpasser learning rate baseret på akkumulerede gradienter. God til sparse data.
- RMSprop. Forbedring af Adagrad der forhindrer learning rate i at falde til nul.
- LAMB/LARS. Optimeret til distribueret træning med store batches på tværs af mange GPU’er.
Loss landscape: terrænet modellen navigerer
Gradient descent navigerer et komplekst fejllandskab:
Globalt minimum
Det dybeste punkt. Den laveste mulige fejl. I praksis er det næsten umuligt at vide om man har nået det globale minimum for store modeller.
Lokale minima
Punkter der er lavere end omgivelserne men ikke det laveste punkt overalt. Modellen kan sidde fast her. I praksis er lokale minima i højdimensionelle rum sjældent et stort problem. De fleste “dale” har udgange i andre dimensioner.
Saddel-punkter
Punkter der er et minimum i nogle dimensioner men et maksimum i andre. I højdimensionelle rum (milliarder af parametre) er saddel-punkter langt mere almindelige end lokale minima og kan bremse træningen.
Flade plateauer
Store områder med næsten ingen gradient. Modellen tager bittesmå skridt og gør langsom fremgang. Momentum og adaptive optimerere hjælper med at krydse plateauer hurtigere.
Gradient descent i praksis
Træning af en sprogmodel
- Data. Milliarder af tekst-tokens fra internettet.
- Batches. Data opdeles i mini-batches af f.eks. 1024 sekvenser.
- Forward pass. Modellen forudsiger næste token for alle sekvenser i batchen.
- Loss. Cross-entropy loss beregnes: gennemsnittet af fejl over alle tokens i batchen.
- Backward pass. Backpropagation beregner gradienter for alle parametre.
- Opdatering. AdamW opdaterer alle parametre baseret på gradienterne.
- Gentag. Millioner af batches over uger af GPU-tid. Loss falder gradvist.
Learning rate schedule
Moderne træning bruger en schedule der varierer learning rate:
- Warmup. Start med en meget lav learning rate og øg den gradvist over de første tusinde skridt. Undgår ustabilitet i starten.
- Peak. Learning rate når sit maksimum.
- Decay. Learning rate reduceres gradvist (lineært eller via cosine schedule) resten af træningen.
Denne schedule (warmup → peak → decay) er standarden for træning af store sprogmodeller.
Distribueret gradient descent
For store modeller fordeles gradient descent over mange GPU’er:
- Hver GPU beregner gradienter for sin del af data.
- All-reduce. Gradienter synkroniseres mellem alle GPU’er (gennemsnit).
- Opdatering. Alle GPU’er opdaterer identisk. Modellen forbliver synkroniseret.
- Skala. Tusindvis af GPU’er kan træne sammen. Større batches og hurtigere konvergens.
Gradient descent og overfitting
Gradient descent minimerer fejlen på træningsdata. Men det er ikke altid godt:
- Overtræning. Hvis gradient descent kører for længe, lærer modellen at memorere træningsdata i stedet for at generalisere. Fejlen på træningsdata falder, men fejlen på ny data stiger.
- Early stopping. Stop træningen når fejlen på valideringsdata (data modellen ikke har set) begynder at stige. Også selvom træningsfejlen stadig falder.
- Weight decay. AdamW tilføjer en straf for store vægte, hvilket forhindrer modellen i at overfitte.
- Dropout. Sluk tilfældige neuroner under træning. Tvinger modellen til at være robust.
Gradient descent er AIs kompas Backpropagation fortæller modellen hvilken retning der er “ned” i fejllandskabet. Gradient descent tager skridtet. Sammen udgør de den motor der driver al moderne AI-træning, fra den mindste classifier til de største sprogmodeller. Det er en simpel idé: gå i den retning der reducerer fejlen mest. Men kombineret med milliarder af parametre, petabytes af data og tusindvis af GPU’er producerer denne simple idé systemer der kan forstå sprog, generere billeder og ræsonnere om verden.
FAQ
Hvad er gradient descent?
Gradient descent er den optimeringsalgoritme der træner AI-modeller ved at justere parametre i den retning der reducerer fejlen mest. Den fungerer ved at beregne gradienten (retningen af stigende fejl) og opdatere parametrene i den modsatte retning. Det er motoren bag al moderne AI-træning.
Hvad er forskellen på gradient descent og backpropagation?
Backpropagation beregner gradienterne. Den finder ud af hvilken retning og hvor meget hver parameter skal justeres. Gradient descent bruger disse gradienter til faktisk at opdatere parametrene. Backpropagation er navigatøren, gradient descent er chaufføren.
Hvad er learning rate?
Learning rate er en hyperparameter der bestemmer hvor stort et skridt modellen tager for hvert gradient descent-trin. For høj learning rate giver ustabilitet (modellen overskrider målet). For lav giver langsom træning. Den rette balance er afgørende for effektiv træning.
Hvad er Adam optimizer?
Adam (Adaptive Moment Estimation) er den mest populære variant af gradient descent i deep learning. Den tilpasser automatisk learning rate for hver parameter baseret på historiske gradienter, hvilket giver hurtigere konvergens og kræver mindre manuel tuning. AdamW-varianten er standarden for træning af store sprogmodeller.