Spring til indhold
AI Ordbog

AI Ordbog

Scaling laws

Matematiske lovmæssigheder der beskriver hvordan AI-modellers performance forbedres forudsigeligt med mere data, større modeller og mere compute.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er scaling laws?

Scaling laws er matematiske lovmæssigheder der beskriver hvordan AI-modellers performance forbedres forudsigeligt når man skalerer tre nøglevariabler: modelstørrelse (antal parametre), datamængde (antal tokens) og compute (beregningsressourcer). Det bemærkelsesværdige er at forbedringerne følger simple, forudsigelige potenslovskurver. Mere af alt giver konsekvent bedre resultater.

Opdagelsen blev publiceret i januar 2020 af Jared Kaplan et al. fra OpenAI i artiklen “Scaling Laws for Neural Language Models.” De viste at sprogmodellers tab (loss, et mål for hvor godt modellen forudsiger tekst) falder som en potenslov af parametre, data og compute:

Loss ∝ 1 / N^α    (N = antal parametre, α ≈ 0.076)
Loss ∝ 1 / D^β    (D = antal tokens, β ≈ 0.095)
Loss ∝ 1 / C^γ    (C = compute i FLOPs, γ ≈ 0.050)

Oversæt til praksis: Fordobl antallet af parametre, og tabet falder med ca. 5%. Tidobl compute, og tabet falder med ca. 12%. Forbedringerne er små per fordobling men akkumulerer massivt over mange størrelsesordener.

Scaling laws har fundamentalt formet AI-industriens strategi. De er den primære grund til at OpenAI, Google, Anthropic og Meta investerer milliarder i stadigt større modeller og compute-infrastruktur.

Hvordan fungerer scaling laws?

De tre variabler

1. Modelstørrelse (parametre, N): Antallet af trænbare vægte i netværket. GPT-3 har 175 milliarder, GPT-4 har angiveligt over en billion. Flere parametre giver modellen mere kapacitet til at lagre og behandle information.

2. Datamængde (tokens, D): Antallet af tokens modellen trænes på. Moderne modeller trænes på billioner af tokens. Mere data giver modellen bredere viden og bedre generalisering.

3. Compute (FLOPs, C): Den samlede mængde beregninger brugt til træning. Compute er en funktion af både parametre og data: C ≈ 6 × N × D. Mere compute kan investeres i enten større model, mere data eller begge.

Potenslovskurver

Scaling laws følger potenslov (power laws). En matematisk relation hvor en variabel stiger proportionalt med en anden variabel opløftet til en potens:

Performance (loss) som funktion af compute:

Loss
    |
    |\
    | \
    |  \
    |   \
    |    \
    |     \___
    |         \____
    |              \_________
    |                        \_______________
    +------------------------------------------------→ Compute (log skala)

Den afgørende egenskab: på en log-log-skala er forholdet en ret linje. Det betyder at forbedringerne er forudsigelige. Man kan ekstrapolere fra små modeller til store modeller med rimelig præcision.

Forudsigelighed

Det mest overraskende aspekt er forudsigeligheden. Scaling laws opdaget på modeller med millioner af parametre holder for modeller med hundredvis af milliarder af parametre. Over flere størrelsesordener. Det giver modeludviklere mulighed for at:

  • Forudsige en stor models performance baseret på eksperimenter med små modeller
  • Beregne det optimale budget (compute) for at opnå en bestemt performance
  • Planlægge infrastrukturinvesteringer med rimelig sikkerhed for afkastet

Kaplan-loven vs. Chinchilla-loven

Kaplan (2020): “Gør modellen større”

Den originale OpenAI-artikel konkluderede at modelstørrelse er den vigtigste variabel. Givet et fast compute-budget bør man prioritere en stor model trænet på relativt lidt data:

  • Anbefaling: Skalér parametre hurtigere end data
  • Ratio: Data burde skalere ca. proportionalt med N^0.74

Denne filosofi drev udviklingen af GPT-3 (175B parametre, 300B tokens). En enorm model trænet på relativt “lidt” data per parameter.

Chinchilla (2022): “Gør datasættet større”

DeepMinds Chinchilla-artikel (“Training Compute-Optimal Language Models”) udfordrede Kaplan-loven. De viste at for et givet compute-budget er det optimalt at balancere model og data mere ligeligt:

  • Anbefaling: Skalér parametre og data i samme takt
  • Tommelfingerregel: Antal tokens ≈ 20 × antal parametre
Kaplan-tilgangChinchilla-tilgang
FilosofiStor model, moderat dataBalanceret model og data
Eksempel280B parametre, 300B tokens70B parametre, 1.4T tokens
ResultatGod men underoptimalSamme performance, mindre model
Inference-costHøj (stor model)Lavere (mindre model)

Chinchilla-loven viste at mange eksisterende modeller var undertrænet. De havde nok parametre men for lidt data. En mindre model trænet på mere data kan matche eller slå en større model trænet på mindre data, og den er billigere at køre bagefter.

Post-Chinchilla (2024-2025)

I praksis har industrien bevæget sig endnu længere i retning af mere data:

  • Llama 3 (70B parametre) blev trænet på 15T tokens. Langt mere end Chinchilla-optimalet
  • Mange modeller overtrænes bevidst fordi inference-cost er vigtigere end trænings-cost

Logikken: en model trænes én gang men bruges millioner af gange. Det er billigere at træne længere (mere data) og få en mindre, hurtigere model end at have en enorm model der er dyr at køre.

Scaling laws i praksis

Compute-budgettering

Scaling laws gør det muligt at planlægge AI-træning som en ingeniørdisciplin:

Eksempel: En virksomhed vil træne en model der scorer mindst 85% på MMLU.

  1. Scaling laws viser at dette kræver ca. X FLOPs compute
  2. X FLOPs kræver Y GPU’er i Z dage
  3. Det koster W millioner dollars
  4. Virksomheden kan beslutte om investeringen er værd det

Infrastrukturinvesteringer

Scaling laws er den primære begrundelse for de massive datacenter-investeringer i AI-industrien. Når man ved at mere compute giver forudsigeligt bedre modeller, bliver compute-infrastruktur en strategisk investering med kvantificerbart afkast.

Modelarkitektur-valg

Scaling laws gælder primært for transformer-arkitekturen. De har motiveret hele industrien til at konvergere mod transformers. Fordi de skalerer forudsigeligt, mens andre arkitekturer ikke nødvendigvis gør det.

Begrænsninger

Diminishing returns

Forbedringerne følger potenslov, hvilket betyder diminishing returns. Hver fordobling giver mindre forbedring end den forrige. At gå fra GPT-3 til GPT-4-skala krævede en størrelsesorden mere compute for en mærkbar men ikke dramatisk forbedring. Prisen for den næste forbedring stiger eksponentielt.

Loss vs. nyttige kapabiliteter

Scaling laws beskriver forbedringer i loss (forudsigelse af næste token). Men lavere loss oversættes ikke altid lineært til bedre brugeroplevelse eller nye kapabiliteter. En model med 10% lavere loss er ikke nødvendigvis 10% bedre til at hjælpe en bruger. Forholdet er mere komplekst.

Data-begrænsninger

Scaling laws antager ubegrænset adgang til kvalitetsdata. I praksis er mængden af høj-kvalitets tekst på internettet begrænset. “Peak data”-hypotesen antyder at vi nærmer os grænsen for tilgængelige træningsdata, hvilket kan bremse skaleringsgevinster.

Miljø og økonomi

At følge scaling laws til deres logiske konklusion kræver eksponentielt voksende energi og infrastruktur. Hvert trin opad i skala fordobler (eller mere) energiforbruget og CO2-udledningen. Der er en reel diskussion om bæredygtigheden af denne tilgang.

Kvalitative spring

Scaling laws beskriver gennemsnitlig performance-forbedring men fanger ikke emergente evner: kvalitative spring i kapabilitet der opstår abrupt ved bestemte skalaer. En models “nytteværdi” kan stige i spring snarere end jævnt, hvilket gør ekstrapolering fra scaling laws alene utilstrækkelig.

Scaling laws og AI-kapløbet

Scaling laws har skabt et AI-kapløb mellem de store tech-virksomheder. Logikken er enkel: mere compute → bedre model → mere markedsandel → flere ressourcer → endnu mere compute. Virksomheder der investerer mest i compute har en forudsigelig fordel.

Det har ført til:

  • Milliard-investeringer i GPU-klynger og datacentre
  • Strategiske partnerskaber (Microsoft-OpenAI, Google-DeepMind, Amazon-Anthropic)
  • Chip-kapløb mellem Nvidia, AMD, Google (TPU), og nye startups
  • Geopolitisk konkurrence mellem USA og Kina om adgang til avancerede AI-chips

Ofte stillede spørgsmål

Hvad er scaling laws i AI?

Scaling laws er matematiske lovmæssigheder der beskriver hvordan AI-modellers performance forbedres forudsigeligt med tre variabler: modelstørrelse (parametre), datamængde (tokens) og compute (beregningsressourcer). Opdaget af OpenAI-forskere i 2020, viser de at forbedringer følger simple potenslovskurver over mange størrelsesordener. Scaling laws har fundamentalt formet AI-industriens strategi og er den primære begrundelse for de massive investeringer i stadigt større modeller.

Hvorfor er scaling laws vigtige?

Scaling laws er vigtige fordi de gør AI-fremskridt forudsigeligt. I stedet for at gætte om en større model vil være bedre, kan forskere ekstrapolere fra eksperimenter med små modeller. Det muliggør rationel planlægning af compute-investeringer, budgettering af træningsomkostninger, og strategiske beslutninger om modelstørrelse og datamængde. De er også årsagen til AI-industriens massive datacenter-investeringer. Når mere compute giver forudsigeligt bedre resultater, bliver compute-infrastruktur en strategisk fordel.

Hvad er forskellen på Kaplan scaling laws og Chinchilla scaling?

Kaplan scaling laws (OpenAI, 2020) konkluderede at modelstørrelse er vigtigst. Givet et fast budget bør man lave den størst mulige model. Chinchilla scaling (DeepMind, 2022) viste at det er optimalt at balancere model og data ligeligt, med ca. 20 tokens per parameter. Chinchilla beviste at mange eksisterende modeller var undertrænet og at en mindre model med mere data kan matche en større models performance til lavere inference-cost. Chinchilla-tilgangen er nu den dominerende praksis.

Vil scaling laws fortsætte med at gælde?

Det er det store spørgsmål. Scaling laws har holdt over mange størrelsesordener, men der er potentielle grænser: tilgængelig træningsdata kan udtømmes (“peak data”), energi- og infrastrukturomkostninger vokser eksponentielt, og diminishing returns betyder at hver forbedring koster mere. Nye tilgange som inference-time compute (at bruge mere beregning under brug i stedet for under træning) og bedre datakuratering kan supplere eller delvist erstatte ren skalering.


Relaterede termer