AI Ordbog
Learning rate
Hvor store skridt en AI-model tager når den opdaterer sine vægte under træning.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er learning rate?
Learning rate bestemmer hvor store skridt modellen tager når den opdaterer sine vægte under træning. Det er en enkelt talværdi, typisk et lille decimaltal som 0.001, der styrer hvor meget vægtene ændres i hvert træningstrin.
Forestil dig at du leder efter det laveste punkt i en dal med bind for øjnene. Du kan mærke hvilken retning der er nedad (gradienten), men du skal beslutte hvor langt du går i hvert skridt. Tager du store skridt, når du hurtigt ned, men risikerer at hoppe over bunden og lande på den anden side. Tager du bittesmå skridt, finder du bunden mere præcist, men det tager enormt lang tid. Learning rate er størrelsen af hvert skridt.
Det er den vigtigste hyperparameter i næsten al deep learning. Sæt den forkert, og intet andet kan redde din træning.
Hvordan fungerer det?
I gradient descent opdateres hver vægt efter formlen:
ny vægt = gammel vægt − learning rate × gradient
- Gradienten fortæller retningen: “fejlen falder hvis denne vægt ændres denne vej.”
- Learning rate fortæller størrelsen: “ændr vægten med dette beløb.”
- Produktet af de to giver den faktiske ændring.
Eksempel med tal
En vægt har værdi 0.5. Gradienten er 0.1 (fejlen falder hvis vægten reduceres).
- Learning rate 0.01: Ny vægt = 0.5 − 0.01 × 0.1 = 0.499. Lille skridt.
- Learning rate 0.1: Ny vægt = 0.5 − 0.1 × 0.1 = 0.49. Større skridt.
- Learning rate 1.0: Ny vægt = 0.5 − 1.0 × 0.1 = 0.4. Stort skridt.
Hvert træningstrin multiplicerer milliarder af gradienter med denne ene learning rate-værdi og opdaterer alle vægte. Derfor har en lille ændring i learning rate enorm effekt.
For høj vs. for lav learning rate
For høj learning rate
- Overskrider målet. Modellen tager så store skridt at den hopper over det optimale punkt.
- Oscillerer. Vægterne bouncer frem og tilbage omkring det optimale uden at lande.
- Divergerer. I værste fald stiger loss i stedet for at falde. Træningen eksploderer: loss bliver NaN (Not a Number).
- Symptom. Loss-kurven er ustabil, spiky eller stiger.
For lav learning rate
- Ekstremt langsom. Modellen gør bittesmå fremskridt og kræver tusindvis af ekstra træningstrin.
- Hænger fast. Modellen kan sidde fast i et lokalt minimum (et punkt der er godt men ikke optimalt) fordi skridtene er for små til at komme ud.
- Spild af compute. GPU-timer er dyre. En learning rate der er 10x for lav kræver groft sagt 10x mere compute.
- Symptom. Loss-kurven falder, men ekstremt langsomt.
Den rette learning rate
- Stabil nedgang. Loss falder jævnt over tid uden store udsving.
- Konvergerer. Modellen når et godt minimum inden for et rimeligt antal steps.
- Generaliser. Modellen performer godt på både træningsdata og valideringsdata.
Typiske learning rate-værdier
| Scenarie | Typisk learning rate | Grund |
|---|---|---|
| Pre-training af LLM | 1e-4 til 3e-4 | Stor model, store batches, lang træning |
| Fine-tuning af LLM | 1e-5 til 5e-5 | Bevarer eksisterende viden |
| Billedklassifikation | 1e-3 til 1e-2 | SGD med momentum |
| Transfer learning | 1e-4 til 1e-3 | Finjustering af pretrained model |
| GAN-træning | 1e-4 til 2e-4 | Stabilitet i adversarial setup |
| LoRA fine-tuning | 1e-4 til 3e-4 | Kun adapter-vægte opdateres |
Learning rate og optimizer
Forskellige optimizers håndterer learning rate forskelligt:
SGD (Stochastic Gradient Descent)
- Simpelt. Vægtene opdateres direkte med learning rate × gradient.
- Følsom. Learning rate skal vælges omhyggeligt. For høj → divergens. For lav → langsom.
- Typisk learning rate. 0.01-0.1 med momentum.
- Bruges stadig. Populær til billedklassifikation. Kan give bedre generalisering end adaptive metoder.
Adam og AdamW
- Adaptiv. Justerer automatisk learning rate per parameter baseret på historiske gradienter.
- Mere robust. Tolererer et bredere interval af learning rates.
- Typisk learning rate. 1e-4 til 1e-3.
- Standarden. AdamW er default optimizer for de fleste transformer-modeller og LLM’er.
Hvorfor adaptiv learning rate hjælper
Ikke alle parametre behøver den samme learning rate. Et parameter der sjældent opdateres bør tage større skridt når det opdateres. Et parameter der opdateres konstant bør tage mindre skridt. Adam håndterer dette automatisk, men den globale learning rate er stadig afgørende.
Learning rate schedules
I stedet for at bruge en fast learning rate hele træningen igennem, varierer de fleste moderne træningskørsler learning rate over tid:
Warmup
- Hvad. Start med en meget lav learning rate og øg den gradvist over de første hundreder til tusinder af steps.
- Hvorfor. I starten af træningen er gradienterne upålidelige fordi vægtene er tilfældigt initialiseret. Store skridt baseret på upålidelige gradienter destabiliserer træningen.
- Typisk. Lineær warmup fra 0 til peak learning rate over 1-10% af total træningstid.
- Hvornår. Næsten altid brugt ved træning af transformer-modeller og store sprogmodeller.
Cosine decay
- Hvad. Efter warmup reduceres learning rate gradvist efter en cosinus-kurve ned mod en minimumsværdi (typisk 0 eller 1/10 af peak).
- Hvorfor. I slutningen af træning vil man have fine-grained justeringer: små skridt der polerer modellen uden at destabilisere.
- Form. Jævn, blød nedgang. Ikke abrupt.
- Standarden. Den mest populære schedule for LLM pre-training.
Step decay
- Hvad. Reducér learning rate med en fast faktor (f.eks. ÷10) ved specifikke milestones.
- Eksempel. Start ved 0.1. Ved epoch 30: 0.01. Ved epoch 60: 0.001.
- Bruges. Klassisk tilgang for billedklassifikation med SGD.
- Ulempe. Kræver at du ved hvornår milestones skal ligge. Mere manuel tuning.
Linear decay
- Hvad. Reducér learning rate lineært fra peak til 0 over træningens forløb.
- Simpelt. Nemt at implementere og forstå.
- Bruges. Populær for fine-tuning af sprogmodeller.
Cyclisk learning rate
- Hvad. Learning rate oscillerer mellem et minimum og maksimum.
- Hvorfor. Kan hjælpe modellen med at undslippe lokale minima.
- Bruges. Mere eksperimentelt. Mindre udbredt end cosine decay.
Warmup + decay: den moderne standard
De fleste state-of-the-art træningskørsler bruger samme mønster:
- Warmup-fase. Learning rate stiger lineært fra ~0 til peak over 500-2000 steps.
- Peak-fase. (Valgfri) Learning rate holder peak-værdi i en kort periode.
- Decay-fase. Learning rate falder gradvist (cosine eller lineær) mod 0 over resten af træningen.
Eksempel: GPT-stil pre-training
- Peak learning rate: 3e-4
- Warmup: 2000 steps (lineær stigning fra 0 til 3e-4)
- Decay: Cosine decay fra 3e-4 til 3e-5 over resterende ~300.000 steps
Eksempel: Fine-tuning af BERT
- Peak learning rate: 2e-5
- Warmup: 10% af total steps
- Decay: Lineær til 0
Learning rate og batch size
Learning rate og batch size er tæt forbundne:
Lineær skaleringsregel
Tommelfingerregel: når du fordobler batch size, fordobl learning rate.
- Batch size 32, learning rate 0.001
- Batch size 64, learning rate 0.002
- Batch size 128, learning rate 0.004
Hvorfor?
Større batches giver mere præcise gradienter. Med en lav learning rate tager modellen for forsigtige skridt i forhold til gradienternes pålidelighed. En højere learning rate udnytter den bedre gradient.
Grænser
Lineær skalering holder kun op til en vis batch size. Derefter giver yderligere forøgelse aftagende udbytte, og learning rate kan ikke skaleres proportionelt uden at skabe ustabilitet. Warmup bliver endnu vigtigere ved store batch sizes.
Learning rate finder
En praktisk teknik til at finde en god learning rate:
- Start lavt. Sæt learning rate til en meget lille værdi (f.eks. 1e-7).
- Øg gradvist. Over én epoch, øg learning rate eksponentielt ved hvert step.
- Plot loss. Plot loss som funktion af learning rate.
- Find sweet spot. Den bedste learning rate er typisk lidt før det punkt hvor loss begynder at stige. Der hvor loss falder hurtigst.
Aflæsning af plottet
- Flad region (lav LR). Loss falder ikke. Learning rate er for lav.
- Stejlt fald. Loss falder hurtigt. God zone.
- Bund. Loss er på sit laveste. Optimal learning rate er typisk her eller lidt til venstre.
- Stigning. Loss stiger igen. Learning rate er for høj.
Learning rate for fine-tuning
Fine-tuning kræver særlig opmærksomhed på learning rate:
Hvorfor lavere learning rate?
- Bevar viden. En pretrained model har allerede lært værdifulde repræsentationer fra enorme datamængder. For høj learning rate ødelægger denne viden. Et fænomen kaldet “catastrophic forgetting.”
- Mindre data. Fine-tuning datasæt er typisk små. Store skridt baseret på få eksempler fører til overfitting.
- Tæt på optimalt. Modellen er allerede tæt på et godt punkt i parameterrummet. Finjustering kræver små, præcise skridt.
Differentieret learning rate
Nogle gange bruges forskellige learning rates til forskellige dele af modellen:
- Lave lag (tidlige lag). Lavere learning rate (f.eks. 1e-5). Disse lag indeholder grundlæggende features (kanter, tekstur, grammatik) der ikke bør ændres meget.
- Høje lag (sene lag). Højere learning rate (f.eks. 1e-4). Disse lag indeholder opgave-specifikke features der skal tilpasses.
- Nyt klassifikationshoved. Højeste learning rate (f.eks. 1e-3). Helt nye lag der skal trænes fra bunden.
Learning rate i praksis
Eksempel: træning af en billedklassificeringsmodel
- Start. Learning rate 0.1, SGD med momentum 0.9, batch size 256.
- Schedule. Step decay: ÷10 ved epoch 30, 60 og 90.
- Observation. Loss falder stabilt. Accuracy stiger gradvist.
- Resultat. 95% test accuracy efter 100 epoker.
Eksempel: fine-tuning af en sprogmodel
- Start. Learning rate 2e-5, AdamW, batch size 16.
- Schedule. Lineær warmup (10% af steps) → lineær decay til 0.
- Observation. Loss falder hurtigt i de første 100 steps, derefter gradvist.
- Resultat. 91% accuracy på opgaven, ingen catastrophic forgetting.
Eksempel: learning rate for ustabil
- Problem. Learning rate 1e-3 til fine-tuning. Loss oscillerer vildt efter 50 steps.
- Diagnose. Learning rate er for høj til fine-tuning.
- Fix 1. Reducér til 2e-5. Stabil træning.
- Fix 2. Alternativt: tilføj warmup. Start ved 1e-7, stig til 1e-4 over 100 steps.
Eksempel: learning rate for langsom
- Problem. Learning rate 1e-7. Loss falder, men kun med 0.001 per epoch.
- Diagnose. Learning rate er for lav.
- Observation. Ved dette tempo tager træningen 100x længere end nødvendigt.
- Fix. Øg til 1e-4. Loss falder 50x hurtigere. Konvergerer inden for rimelig tid.
Learning rate og modellens endelige kvalitet
Learning rate påvirker ikke bare træningstid. Den påvirker også hvor god modellen bliver:
Sharp vs. flat minima
- Høj learning rate. Tenderer mod at finde brede, flade minima i loss-landskabet. Disse generaliserer typisk bedre til nye data.
- Lav learning rate. Tenderer mod at finde smalle, skarpe minima. Disse kan overfitte til træningsdata.
- Intuition. Et fladt minimum er robust: en lille ændring i input ændrer ikke output meget. Et skarpt minimum er skrøbeligt.
Warmup restart
Nogle teknikker genstarter learning rate periodisk (cosine annealing with warm restarts). Modellen “rystes løs” fra et lokalt minimum og finder potentielt et bedre punkt.
Avancerede learning rate-koncepter
Layer-wise learning rate decay (LLRD)
For transformer-modeller: hvert lag får en learning rate der er en faktor lavere end laget over det.
- Øverste lag. Learning rate = base (f.eks. 2e-5).
- Lag under. Learning rate = base × 0.95.
- Laget under det. Learning rate = base × 0.95².
- Og så videre. Dybere lag ændres mindre.
- Effekt. Bevarer grundlæggende repræsentationer i dybere lag, tilpasser opgave-specifikke repræsentationer i øvre lag.
Learning rate for forskellige parametergrupper
Moderne frameworks tillader at sætte individuelle learning rates:
- Embedding-lag. Ofte lavere learning rate.
- Attention-vægte. Standard learning rate.
- Bias-termer. Ofte ingen weight decay, standard learning rate.
- Normalization-lag. Ofte ingen weight decay.
Learning rate er den ene knap der betyder mest Af alle de beslutninger du træffer under modeltræning, er learning rate den mest afgørende. For høj, og modellen lærer aldrig. For lav, og du spilder compute og tid. Den rette learning rate (ofte kombineret med warmup og decay) er forskellen mellem en model der konvergerer stabilt til gode resultater og en der aldrig finder sit fodfæste. Start med kendte gode defaults (3e-4 for AdamW pre-training, 2e-5 for fine-tuning), brug en schedule med warmup og decay, og justér derfra. Det er den vigtigste hyperparameter af en grund.
FAQ
Hvad er learning rate?
Learning rate er en hyperparameter der bestemmer hvor store skridt en AI-model tager når den opdaterer sine vægte under træning. En learning rate på 0.001 betyder at hver vægt ændres med 0.001 gange gradienten ved hvert træningstrin. Det er den vigtigste hyperparameter i deep learning.
Hvad er en god learning rate?
Det afhænger af opgaven og optimizer. For AdamW (den mest brugte optimizer) er 1e-4 til 3e-4 en god start for pre-training og 1e-5 til 5e-5 for fine-tuning. For SGD er 0.01-0.1 med momentum typisk. Brug altid en learning rate schedule med warmup og decay.
Hvad sker der hvis learning rate er for høj?
Modellen tager for store skridt og overskrider det optimale punkt. Loss oscillerer eller stiger i stedet for at falde. I værste fald divergerer træningen: loss bliver uendelig eller NaN. Løsningen er at reducere learning rate eller tilføje warmup.
Hvad er en learning rate schedule?
En learning rate schedule varierer learning rate over træningens forløb. Den mest brugte tilgang er warmup (start lav, stig gradvist) efterfulgt af decay (fald gradvist mod 0). Det giver stabil start og præcis finjustering mod slutningen. Cosine decay er den mest populære schedule for store modeller.