Spring til indhold
AI Ordbog

AI Ordbog

Chinchilla scaling

En scaling law fra DeepMind der viser at AI-modeller bør trænes på ca. 20 tokens per parameter for optimal performance.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er Chinchilla scaling?

Chinchilla scaling er en empirisk lov der beskriver den optimale balance mellem modelstørrelse og datamængde givet et fast compute-budget. Den viser at AI-modeller bør trænes på markant mere data end tidligere antaget. Mange af de mest kendte modeller var undertrænet.

Navnet stammer fra DeepMinds model “Chinchilla”, en 70 milliarder parameter-model der outperformede den fire gange større Gopher (280B parametre) ved at blive trænet på fire gange så meget data. Chinchilla beviste at en mindre model med mere data slår en større model med mindre data, givet det samme compute-budget.

Forskningsartiklen “Training Compute-Optimal Language Models” (Hoffmann et al., 2022) ændrede fundamentalt hvordan AI-industrien tænker om modeltræning. Før Chinchilla var den dominerende strategi at bygge den størst mulige model. Efter Chinchilla skiftede fokus til at balancere model og data, og i mange tilfælde at prioritere mere data.

Chinchilla-lovens kernebudskab

Tommelfingerreglen

Den mest citerede konklusion er enkel:

Antal tokens ≈ 20 × antal parametre

ParametreOptimalt antal tokens
1B (1 milliard)20B tokens
7B140B tokens
70B1.4T (1.4 billioner) tokens
175B3.5T tokens
1T (1 billion)20T tokens

Hvad det ændrede

Før Chinchilla var standarden at bygge modeller med mange parametre men relativt lidt træningsdata:

Model (pre-Chinchilla)ParametreTokensTokens/Parameter
GPT-3175B300B1.7
Gopher280B300B1.1
Megatron-Turing530B270B0.5

Alle disse modeller var massivt undertrænet ifølge Chinchilla-loven. De brugte 10-40x for lidt data per parameter.

Model (post-Chinchilla)ParametreTokensTokens/Parameter
Chinchilla70B1.4T20
Llama 270B2T29
Llama 370B15T214
Mistral 7B7B~2T~286

Post-Chinchilla-modeller bruger markant mere data, og mange overskrider endda Chinchilla-optimalet bevidst.

Hvorfor er Chinchilla scaling vigtig?

Mindre modeller, samme kvalitet

Chinchilla-lovens mest umiddelbare konsekvens: man kan opnå samme kvalitet med en mindre model ved at træne den på mere data. En 70B Chinchilla-model matchede eller slog den 280B Gopher. På en fjerdedel af parametrene.

Det har massive praktiske konsekvenser:

  • Lavere inference-cost: En 70B-model er markant billigere at køre end en 280B-model
  • Hurtigere svar: Færre parametre = hurtigere generering
  • Mindre hardware: Kan køre på færre GPU’er
  • Bredere tilgængelighed: Mindre modeller kan deployes af flere virksomheder

Ændret investeringsstrategi

Før Chinchilla fokuserede AI-investeringer primært på GPU-klynger til at træne og køre enorme modeller. Efter Chinchilla skiftede fokus til også at inkludere datatilgang og datakuratering. Adgang til store, høj-kvalitets datasæt blev et strategisk aktiv.

Open source-revolution

Chinchilla-loven var en afgørende faktor i open source-modellers succes. Modeller som Llama, Mistral og Phi viste at relativt små modeller (7B-70B) trænet på enorme datamængder kan konkurrere med langt større proprietære modeller. De er små nok til at mange kan bruge dem.

Chinchilla vs. Kaplan

Den originale Kaplan scaling law

OpenAIs Kaplan et al. (2020) konkluderede at modelstørrelse er vigtigere end datamængde. Givet et fast compute-budget bør man prioritere parametre:

  • Kaplan: Skalér model hurtigere end data
  • Implikation: Byg den størst mulige model, selv med begrænset data

Chinchilla-korrektionen

Chinchilla (2022) viste at Kaplans konklusion var forkert. Sandsynligvis fordi Kaplans eksperimenter ikke trænede modellerne tilstrækkeligt lang tid:

  • Chinchilla: Skalér model og data ligeligt
  • Implikation: Balancér parametrene med tilstrækkeligt data

Hvorfor Kaplan tog fejl

Kaplans eksperimenter stoppede træningen tidligt, før modellerne havde konvergeret. Det gav et skævt billede af forholdet mellem model og data. Chinchilla trænede modeller til konvergens og fandt et fundamentalt andet optimum.

Beyond Chinchilla: Overtræning

I 2024-2025 har mange modeludviklere bevidst valgt at overtræne deres modeller langt ud over Chinchilla-optimalet:

ModelChinchilla-optimal dataFaktisk dataOvertræning
Llama 3 8B160B tokens15T tokens~94x
Mistral 7B140B tokens~2T tokens~14x
Phi-3 Mini (3.8B)76B tokens3.3T tokens~43x

Hvorfor overtræne?

Inference-cost dominerer: En model trænes én gang men bruges millioner af gange. Det er billigere at træne en lille model længe end at køre en stor model mange gange.

Bedre end forventet: Overtræning giver bedre resultater end Chinchilla-loven forudsiger. Modellerne fortsætter med at forbedres ud over det “optimale” punkt. Bare langsommere.

Compute er billigere end inference: GPU-timer til træning er en engangsinvestering. GPU-timer til inference er en løbende udgift. At bruge ekstra compute under træning for at spare under inference er en rationel afvejning.

Chinchilla scaling i praksis

For modeludviklere

  1. Start med Chinchilla-optimalet som baseline: 20 tokens per parameter
  2. Overvej overtræning for modeller der skal deployes bredt. Inference-savings kan retfærdiggøre ekstra trænings-compute
  3. Datakvalitet trumfer kvantitet. 1T tokens af høj kvalitet slår 10T tokens af lav kvalitet
  4. Monitorer valideringstab. Stop ikke træningen for tidligt (Kaplan-fejlen), men stop når tabet flader ud

For virksomheder

Chinchilla-loven har en klar implikation for virksomheder der vælger modeller: mindre, veltrænede modeller er ofte bedre end større, undertrænet modeller. En 7B-model trænet på billioner af tokens kan matche en 70B-model trænet på hundredvis af milliarder tokens. Og den er 10x billigere at køre.

For AI-strategi

Chinchilla ændrede magtbalancen i AI. Adgang til data blev lige så vigtigt som adgang til compute. Virksomheder med store, unikke datasæt (forlag, medievirksomheder, specialiserede domæner) har nu et strategisk aktiv i AI-udvikling.

Ofte stillede spørgsmål

Hvad er Chinchilla scaling?

Chinchilla scaling er en empirisk lov fra DeepMinds forskning (2022) der viser at den optimale træning af en AI-model kræver ca. 20 tokens data per parameter. En 70B-model bør trænes på ca. 1.4 billioner tokens. Chinchilla-loven beviste at mange store modeller (herunder GPT-3) var undertrænet. De havde mange parametre men for lidt data. En mindre model med mere data kan matche eller slå en større model med mindre data, givet det samme compute-budget.

Hvordan ændrede Chinchilla AI-industrien?

Chinchilla ændrede fokus fra “byg den størst mulige model” til “balancér model og data.” Det førte til fire store ændringer: (1) Mindre modeller med mere data blev standarden. (2) Datakvalitet og datatilgang blev strategisk vigtig. (3) Open source-modeller (Llama, Mistral) kunne konkurrere med proprietære modeller ved at være veltrænede. (4) Inference-cost blev et centralt designkriterium. Mindre modeller er billigere at køre.

Følger moderne modeller stadig Chinchilla-loven?

De fleste moderne modeller overskrider Chinchilla-optimalet markant. De overtrænes bevidst med langt mere data end 20 tokens per parameter. Llama 3 bruger f.eks. over 200 tokens per parameter. Årsagen er at inference-cost dominerer: det er billigere at træne en lille model længere end at køre en stor model mange gange. Chinchilla-loven er stadig et godt udgangspunkt, men i praksis er mere data næsten altid bedre.

Hvad er forskellen på Chinchilla scaling og Kaplan scaling laws?

Kaplan scaling laws (OpenAI, 2020) konkluderede at modelstørrelse er vigtigst og at man bør bygge den størst mulige model. Chinchilla (DeepMind, 2022) viste at model og data bør skaleres ligeligt, ca. 20 tokens per parameter. Forskellen skyldes at Kaplans eksperimenter stoppede træningen for tidligt, før modellerne havde konvergeret. Chinchilla-loven er nu den dominerende reference, og i praksis bruger mange endda mere data end Chinchilla anbefaler.


Relaterede termer