Spring til indhold
AI Ordbog

AI Ordbog

Hyperparameter

Indstillinger der styrer træningsprocessen og som sættes før træning begynder.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er en hyperparameter?

En hyperparameter er en indstilling du vælger før træningen begynder. Det er de “knapper” du drejer på for at kontrollere hvordan modellen lærer. Ikke hvad den lærer.

Forskellen er afgørende: en parameter (vægt) er noget modellen selv lærer under træning via backpropagation og gradient descent. En hyperparameter er noget du som udvikler beslutter på forhånd.

Analogi: forestil dig at du lærer at spille klaver. Parametrene er din muskelhukommelse og fingerteknik, det du lærer ved at øve. Hyperparametrene er de beslutninger du træffer om øveprocessen: hvor mange timer om dagen (learning rate), hvilke stykker du øver (data), hvor lang tid du øver hvert stykke (epoker), og om du har en lærer der korrigerer dig (regularisering).

Parameter vs. hyperparameter

ParameterHyperparameter
Hvem sætter denModellen lærer denUdvikler vælger den
HvornårUnder træningFør træning
Hvordan opdateres denGradient descentManuel, grid search, auto-tuning
EksemplerVægte, biasesLearning rate, batch size, antal lag
AntalMillioner til milliarderTypisk titals
Gemt iModelvægte-filenTræningskonfigurationen

De vigtigste hyperparametre

Learning rate

Den vigtigste hyperparameter i deep learning:

  1. Hvad den styrer. Størrelsen af hvert opdateringsskridt under gradient descent. Hvor meget vægtene ændres for hvert træningstrin.
  2. For høj. Modellen overskrider målet, bouncer ustabilt og konvergerer aldrig.
  3. For lav. Modellen gør bittesmå fremskridt og kræver enorm tid for at konvergere.
  4. Typiske værdier. 1e-4 til 1e-2 for deep learning. 1e-5 til 1e-4 for fine-tuning af store sprogmodeller.
  5. Learning rate schedule. Ofte varieres learning rate under træning: warmup → peak → decay.

Batch size

Antal træningseksempler der processeres per opdatering:

  1. Hvad den styrer. Hvor mange eksempler modellen ser før den opdaterer sine vægte.
  2. Lille batch (32-128). Mere støjende gradienter men hurtigere opdateringer. Kan generalisere bedre.
  3. Stor batch (1024-4096+). Mere stabile gradienter, bedre GPU-udnyttelse. Kræver højere learning rate.
  4. Afvejning. Større batches er hurtigere per token (bedre GPU-parallelisme) men kan kræve mere tuning.
  5. Typiske værdier. 32-256 for fine-tuning, 1024-4096 for pre-training af store modeller.

Antal epoker

Hvor mange gange modellen ser hele træningsdatasættet:

  1. For få. Modellen har ikke lært nok (underfitting).
  2. For mange. Modellen memorerer træningsdata (overfitting).
  3. Sweet spot. Varierer enormt. Fine-tuning: 1-5 epoker. Klassisk ML: 10-100 epoker. Store sprogmodeller: ofte under 1 epoke (dataene ses kun delvist).
  4. Early stopping. Ofte bruges valideringserror til at stoppe automatisk. Uanset indstillet antal epoker.

Antal lag og neuroner

Modellens arkitektur:

  1. Antal lag (dybde). Dybere modeller kan lære mere komplekse mønstre men er sværere at træne.
  2. Antal neuroner per lag (bredde). Bredere lag giver mere kapacitet men kræver mere hukommelse og compute.
  3. For store modeller. Risiko for overfitting og unødvendig compute.
  4. For små modeller. Risiko for underfitting.

Dropout rate

Hvor stor en andel af neuroner der slukkes tilfældigt under træning:

  1. Typiske værdier. 0.1-0.5 (10-50% af neuroner deaktiveres).
  2. Højere dropout. Mere regularisering. Modellen tvinges til at være mere robust. Risiko for underfitting.
  3. Lavere dropout. Mindre regularisering. Hurtigere læring. Risiko for overfitting.

Weight decay

Styrken af L2-regularisering:

  1. Hvad den styrer. Hvor meget modellen straffes for store parameterværdier.
  2. Typiske værdier. 0.01-0.1 for AdamW.
  3. Højere. Mere regularisering, simplere model.
  4. Lavere. Modellen har mere frihed, risiko for overfitting.

Temperature (ved inference)

Kontrollerer tilfældigheden i modellens output:

  1. Hvad den styrer. Hvor “kreativ” eller “deterministisk” modellen er under tekstgenerering.
  2. Lav (0.0-0.3). Mere forudsigelig, gentagende output.
  3. Høj (0.8-1.5). Mere kreativt, varieret output.
  4. Note. Teknisk set en inference-hyperparameter, ikke en trænings-hyperparameter.

Hyperparameter-søgning

At finde de rette hyperparametre er en kunst og en videnskab:

  1. Hvad. Definer et gitter af mulige værdier for hver hyperparameter. Prøv alle kombinationer.
  2. Eksempel. Learning rate: [0.001, 0.01, 0.1] × Batch size: [32, 128, 512] = 9 eksperimenter.
  3. Fordel. Grundig. Alle kombinationer testes.
  4. Ulempe. Kombinationseksplosion. Med 5 hyperparametre à 5 værdier = 3.125 eksperimenter. Dyrt.
  1. Hvad. Vælg tilfældige kombinationer af hyperparametre fra definerede intervaller.
  2. Fordel. Overraskende effektiv. Ofte bedre end grid search med samme budget fordi den dækker parameterrummet bredere.
  3. Ulempe. Kan misse gode kombinationer ved uheld.
  4. Hvornår. Standarden for de fleste praktikere. 20-50 tilfældige kombinationer giver typisk et godt resultat.

Bayesian optimization

  1. Hvad. Brug resultaterne fra tidligere eksperimenter til at vælge de mest lovende næste kombinationer intelligent.
  2. Fordel. Finder gode kombinationer med færre eksperimenter end grid search og random search.
  3. Ulempe. Mere kompleks at implementere.
  4. Værktøjer. Optuna, Weights & Biases Sweeps, Ray Tune.

Manuelt

  1. Hvad. Start med kendte gode værdier (fra papers, erfaringer) og juster baseret på observation.
  2. Fordel. Hurtig iteration for erfarne praktikere. Bygger intuition.
  3. Ulempe. Afhænger af erfaring. Kan misse gode kombinationer.
  4. Hvornår. Det meste af AI-praksis starter manuelt med kendte defaults.

Hyperparametre for store sprogmodeller

Træning af modeller som GPT og Claude kræver særlige hyperparametre:

Pre-training

  1. Learning rate. Typisk 1e-4 til 3e-4 med warmup og cosine decay.
  2. Batch size. Meget stor: millioner af tokens per batch, fordelt over tusindvis af GPU’er.
  3. Kontekstlængde. 2048-128.000 tokens afhængigt af modellen.
  4. Antal lag / dimensioner. Bestemmer modellens størrelse: 7B, 70B, 400B+ parametre.
  5. Epoker. Ofte under 1, datamængden er så stor at modellen ikke ser alt.

Fine-tuning

  1. Learning rate. Markant lavere end pre-training: 1e-5 til 5e-5. For høj learning rate ødelægger modellens eksisterende viden.
  2. Batch size. Mindre: 4-64 eksempler.
  3. Epoker. 1-5. Mere giver overfitting på det lille fine-tuning datasæt.
  4. LoRA rank. For LoRA fine-tuning: typisk 8-64. Højere rank = mere kapacitet men mere risiko for overfitting.

Inference

  1. Temperature. 0.0-1.5 afhængigt af use case.
  2. Top-p. 0.9-1.0 for de fleste opgaver.
  3. Max tokens. Maksimal output-længde.
  4. System prompt. Teknisk set en hyperparameter for modellens adfærd.

Hyperparametre i praksis

Eksempel: fine-tuning af en chatbot

  1. Start med defaults. Learning rate: 2e-5, batch size: 16, epoker: 3, weight decay: 0.01.
  2. Træn og evaluer. Mål performance på et valideringssæt.
  3. Justér. Hvis modellen overfitter (valideringserror stiger): reducer epoker, øg weight decay. Hvis den underfitter: øg learning rate eller epoker.
  4. Iteration. 3-5 eksperimenter er typisk nok til at finde gode hyperparametre for fine-tuning.

Eksempel: billedklassifikation

  1. Grid search. Test learning rate [1e-3, 1e-4, 1e-5] × batch size [32, 64, 128] × dropout [0.1, 0.3, 0.5].
  2. 27 eksperimenter. Kør hvert i 20 epoker med early stopping.
  3. Bedste kombination. Learning rate 1e-4, batch size 64, dropout 0.3 giver bedst valideringsaccuracy.
  4. Final model. Træn med de bedste hyperparametre på al træningsdata.

Gode defaults

Erfarne praktikere starter typisk med kendte gode standardværdier:

HyperparameterGod startværdi
Learning rate (AdamW)3e-4 (pre-training), 2e-5 (fine-tuning)
Batch size32-256 (afhænger af GPU-hukommelse)
Weight decay0.01-0.1
Dropout0.1
Warmup steps1-10% af total steps
Epoker (fine-tuning)3

Disse er udgangspunkter, ikke universelle sandheder. Den bedste hyperparameter afhænger altid af opgaven, datasættet og modellen.

Hyperparametre er AI-træningens kontrolpanel En AI-model kan have milliarder af parametre den selv lærer. Men den lærer dem kun godt hvis de titals hyperparametre der styrer træningsprocessen er sat korrekt. For høj learning rate og modellen divergerer. For lille batch size og træningen er ineffektiv. For mange epoker og modellen overfitter. At finde de rette hyperparametre er en blanding af videnskab (systematisk søgning), kunst (erfaring og intuition) og pragmatisme (start med kendte defaults og justér). Det er en af de mest praktiske og vigtige færdigheder i maskinlæring.


FAQ

Hvad er en hyperparameter?

En hyperparameter er en indstilling du vælger før træning af en AI-model begynder. For eksempel learning rate, batch size og antal epoker. I modsætning til modellens parametre (vægte), som modellen selv lærer under træning, sættes hyperparametre manuelt eller via automatisk søgning.

Hvad er forskellen på parametre og hyperparametre?

Parametre (vægte, biases) læres af modellen under træning via gradient descent. Der er milliarder af dem. Hyperparametre (learning rate, batch size, dropout) vælges af udvikler før træning. Der er typisk titals. Parametre bestemmer hvad modellen ved; hyperparametre bestemmer hvordan den lærer.

Hvad er den vigtigste hyperparameter?

Learning rate er næsten altid den vigtigste. Den bestemmer hvor store skridt modellen tager under gradient descent. For høj og træningen divergerer; for lav og den konvergerer ekstremt langsomt. Batch size og antal epoker er de næstvigtigste.

Hvordan finder man de bedste hyperparametre?

Start med kendte gode standardværdier (defaults). Eksperimenter med random search eller Bayesian optimization over et defineret interval. Evaluer altid på et separat valideringsdatasæt. Aldrig på træningsdata. For de fleste opgaver giver 20-50 eksperimenter en god løsning.


Relaterede termer