AI Ordbog
Sparse model
En AI-model hvor kun en delmængde af parametrene aktiveres for hvert input, i modsætning til en tæt model hvor alle parametre bruges.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er en sparse model?
En sparse model er en AI-model hvor kun en del af parametrene aktiveres for hvert input. Resten af parametrene er til stede i modellen men deltager ikke i beregningen for det specifikke input. Det er i kontrast til en tæt (dense) model, hvor alle parametre bruges til hvert eneste input.
Tænk på det som en stor virksomhed med 1.000 medarbejdere. En tæt model svarer til at alle 1.000 medarbejdere arbejder på hvert eneste projekt, uanset om det er et regnskabsproblem eller en marketingkampagne. En sparse model svarer til at virksomheden har 1.000 medarbejdere men kun aktiverer de 100 mest relevante for hvert projekt. Virksomheden har stadig den fulde kompetence (alle 1.000 medarbejdere), men bruger ressourcerne langt mere effektivt.
Sparsity er blevet en af de vigtigste strategier i moderne AI, fordi den løser et fundamentalt problem: modeller bliver bedre jo større de er, men beregningsomkostningerne vokser proportionalt med størrelsen. Sparse modeller bryder denne lineære sammenhæng. De giver modeller med stor kapacitet men overkommelige beregningsomkostninger.
Tæt vs. sparse: Det grundlæggende
Tæt model (dense)
Input → [Alle 100 milliarder parametre aktiveret] → Output
Beregning: ~100 milliarder operationer per token
Hvert input processeres af alle modellens parametre. Beregningsomkostningen er proportional med det totale antal parametre.
Sparse model
Input → [Router vælger relevante parametre] → [20 milliarder parametre aktiveret] → Output
Beregning: ~20 milliarder operationer per token
Hvert input processeres kun af en delmængde af parametrene. Beregningsomkostningen er proportional med antallet af aktive parametre, ikke det totale antal.
Nøgletal
| Metric | Tæt model (70B) | Sparse model (8x7B MoE) |
|---|---|---|
| Total parametre | 70 milliarder | 47 milliarder |
| Aktive parametre per token | 70 milliarder | 13 milliarder |
| Kvalitet | Baseline | Tilsvarende eller bedre |
| Compute per token | 1x | ~0.2x |
| Hukommelsesbehov | 70B parametre | 47B parametre |
| Inference-hastighed | Baseline | ~3-4x hurtigere |
Typer af sparsity
Struktureret sparsity: Mixture of Experts (MoE)
Den mest udbredte form for sparsity i moderne sprogmodeller. Modellens feed-forward lag erstattes af mange “eksperter” (mindre feed-forward netværk), og en router vælger hvilke eksperter der aktiveres for hvert token.
Eksempel: Mixtral 8x7B har 8 eksperter og aktiverer 2 per token. Total kapacitet: 47B parametre. Aktiv compute: 13B parametre.
Fordele: Veldefineret struktur. Effektiv på moderne hardware. Bevist i stor skala.
Ulemper: Kræver stadig hukommelse til alle eksperter. Routing-overhead. Kommunikation mellem GPU’er.
Ustruktureret sparsity (weight pruning)
Individuelle vægte (parametre) i modellen sættes til nul. De nuljede vægte kan springes over i beregningen.
Eksempel: En model med 70B parametre hvor 50% af vægtene er nul. Effektivt kun 35B aktive parametre.
Fordele: Kan anvendes på eksisterende modeller uden arkitekturændringer. Fleksibelt.
Ulemper: Svært at accelerere på standard GPU-hardware fordi nul-mønstret er uregelmæssigt. Kræver specialiseret hardware eller software for reel hastighedsgevinst.
Semi-struktureret sparsity (N:M sparsity)
En mellemform hvor sparsity følger et regelmæssigt mønster. For eksempel 2:4 sparsity: ud af hver gruppe på 4 vægte er præcis 2 nul.
Eksempel: NVIDIA’s Ampere og nyere GPU’er har hardware-support for 2:4 sparsity, hvilket giver ~2x hastighedsforbedring.
Fordele: Hardware-accelereret. Struktureret nok til effektiv beregning. Fleksibelt nok til at bevare kvalitet.
Ulemper: Begrænset til specifikke sparsity-mønstre. Kræver GPU’er med hardware-support.
Aktiverings-sparsity
I stedet for at fjerne parametre fra modellen udnytter man at mange neuroner naturligt producerer nul-output (f.eks. via ReLU-aktivering). Kun neuroner med non-zero output bidrager til beregningen.
Fordele: Kræver ingen ændring af modellen. Naturligt forekommende.
Ulemper: Graden af sparsity varierer med input. Sværere at forudsige og optimere.
Sparsity i praksis
Hvorfor sparsity er nødvendig
AI-modeller følger skaleringslovene: mere data, mere compute og flere parametre giver bedre performance. Men de tre ressourcer er begrænsede og dyre. Sparsity er en vej til at bryde begrænsningen:
- Træning: En sparse model kan trænes hurtigere fordi færre beregninger per token betyder flere tokens kan processeres per tidsenhed
- Inference: Brugere får hurtigere svar og lavere latens
- Økonomi: Lavere compute per token = lavere pris per API-kald
- Skalerbarhed: Større modeller bliver mulige inden for eksisterende hardware-budgetter
Hvem bruger sparse modeller?
De fleste frontier-modeller bruger en form for sparsity:
- GPT-4 (OpenAI): Bredt rapporteret at bruge MoE-arkitektur
- Gemini (Google): MoE-baseret
- Mixtral (Mistral AI): Open source MoE
- DeepSeek-V3: MoE med fine-grained eksperter
- Grok (xAI): MoE-arkitektur
Trenden er klar: de mest kapable modeller er sparse, fordi det er den mest effektive måde at skalere kapacitet.
Sparse modeller og hardware
Sparsity stiller specifikke krav til hardware:
GPU-hukommelse: Alle parametre skal kunne tilgås, selvom kun en delmængde bruges. En sparse model med 1T total parametre kræver hukommelse til 1T parametre.
Kommunikation: I MoE-arkitekturer skal tokens sendes til de GPU’er der hoster de relevante eksperter. Hurtig inter-GPU-kommunikation er kritisk.
Specialiseret hardware: NVIDIA’s nyere GPU’er (Ampere, Hopper, Blackwell) har specifik hardware-support for sparse beregninger. Googles TPU’er er designet med sparsity i tankerne.
Sparsity vs. andre effektivitetsteknikker
| Teknik | Hvad den gør | Effekt |
|---|---|---|
| Sparsity (MoE) | Aktiverer kun dele af modellen | Mindre compute, samme kapacitet |
| Quantization | Reducerer præcisionen af vægte (32-bit → 4-bit) | Mindre hukommelse, hurtigere beregning |
| Distillation | Træner en lille model til at efterligne en stor | Mindre model med lignende kvalitet |
| Pruning | Fjerner unødvendige vægte permanent | Mindre model, hurtigere inference |
| KV-cache optimering | Komprimerer mellemresultater under generering | Mindre hukommelsesforbrug under inference |
Disse teknikker er komplementære og kan kombineres. En sparse MoE-model kan kvantiseres, pruned og optimeres yderligere for at opnå endnu bedre effektivitet.
Forskellen mellem sparse og small
Det er vigtigt at skelne: en sparse model er ikke det samme som en lille model.
Lille model (f.eks. 7B dense): 7 milliarder parametre. Alle bruges. Begrænset kapacitet.
Sparse model (f.eks. 8x7B MoE): 47 milliarder parametre total, 13 milliarder aktive. Stor kapacitet, moderat compute.
Den sparse model har markant mere viden og kapacitet end den lille model. Den bruger bare sine ressourcer mere effektivt. Det er forskellen mellem en lille bil (lille motor, lav kapacitet) og en hybrid (stor motor der ikke altid kører på fuld kraft).
Fremtiden for sparse modeller
Finere granularitet: Fremtidige MoE-modeller vil sandsynligvis bruge flere, mindre eksperter med mere præcis routing. I stedet for 8 store eksperter, 128 eller 256 mindre eksperter der giver finere specialisering.
Hardware-co-design: GPU’er og AI-acceleratorer designes i stigende grad med sparsity som en primær designparameter. Det vil gøre sparse beregninger endnu mere effektive.
Adaptiv sparsity: Modeller der dynamisk justerer deres sparsity baseret på inputtets kompleksitet. Simple inputs bruger færre parametre, komplekse inputs aktiverer flere.
Sparsity under træning: I dag trænes de fleste modeller dense og gøres sparse efterfølgende (via pruning eller MoE). Fremtidige tilgange vil træne sparse fra starten, hvilket sparer enorme træningsomkostninger.
Edge-deployment: Sparse modeller der er designet til at køre på enheder med begrænset compute (smartphones, IoT-enheder) ved at aktivere meget få parametre per inference.
Ofte stillede spørgsmål
Hvad er en sparse model?
En sparse model er en AI-model hvor kun en delmængde af parametrene aktiveres og bruges til beregning for hvert input. I modsætning til en tæt (dense) model, hvor alle parametre deltager i hvert eneste input, bruger en sparse model en routing-mekanisme til at vælge de mest relevante parametre. Det giver modellen stor samlet kapacitet men lavere beregningsomkostninger per input. Den mest udbredte form er Mixture of Experts (MoE), hvor modellen har mange specialiserede undernetværk og en router vælger hvilke der aktiveres.
Hvad er forskellen på en sparse model og en tæt model?
I en tæt (dense) model bruges alle parametre til hvert input. 70 milliarder parametre betyder 70 milliarder beregninger per token. I en sparse model bruges kun en delmængde, f.eks. 13 milliarder ud af 47 milliarder. Det betyder at en sparse model kan have mere kapacitet (viden lagret i alle parametrene) men lavere beregningsomkostninger (kun en brøkdel bruges per token). Afvejningen er at sparse modeller kræver mere hukommelse (alle parametre skal være tilgængelige) og er mere komplekse at træne og deploye.
Hvorfor er sparse modeller vigtige?
Fordi de løser et fundamentalt problem i AI-skalering: modeller bliver bedre jo større de er, men beregningsomkostningerne vokser proportionalt. Sparse modeller bryder denne lineære sammenhæng ved at give stor kapacitet med moderat compute. Det er grunden til at de mest avancerede AI-modeller (GPT-4, Gemini, Mixtral, DeepSeek-V3) alle bruger sparse arkitekturer. Uden sparsity ville disse modeller enten være langsommere, dyrere eller mindre kapable.
Er sparse modeller altid bedre end tætte modeller?
Ikke altid. For små modeller (under ~10 milliarder parametre) er tætte modeller ofte mere effektive, fordi overhead fra routing og ekspertstyring opvejer besparelserne. Sparse modeller exceller ved stor skala, hvor kapacitetsfordelen er markant. Derudover kræver sparse modeller mere hukommelse end en tæt model med samme antal aktive parametre, og de kan være sværere at træne stabilt. Valget afhænger af modelstørrelse, hardware-setup og use case.