Spring til indhold
AI Ordbog

AI Ordbog

Mixture of Experts (MoE)

En modelarkitektur hvor kun en delmængde af modellens parametre aktiveres for hvert input, hvilket giver stor kapacitet med lavere beregningsomkostninger.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er Mixture of Experts?

Mixture of Experts (MoE) er en arkitektur for neurale netværk hvor modellen består af mange specialiserede undernetværk, kaldet “eksperter”. En router (gating-mekanisme) der for hvert input beslutter hvilke eksperter der skal aktiveres. I stedet for at bruge hele modellen til hvert input bruger MoE kun en delmængde.

Forestil dig et hospital. Når en patient kommer ind, bliver de ikke undersøgt af alle hospitalets læger. En triage-sygeplejerske (routeren) vurderer patienten og sender dem videre til de relevante specialister (eksperterne): kardiologen for hjerteproblemer, ortopæden for knoglebrud. Hospitalet har mange specialister (stor kapacitet), men kun de relevante aktiveres per patient (effektiv ressourcebrug).

På samme måde har en MoE-model mange parametre fordelt på mange eksperter, men kun en brøkdel af dem bruges til hvert enkelt input. Det giver to store fordele: modellen kan have enorm kapacitet (viden lagret på tværs af alle eksperter) men kræver betydeligt mindre beregning per token end en tilsvarende “tæt” model.

MoE er ikke en ny idé. Konceptet blev først foreslået i 1991. Men det har fået ny relevans med store sprogmodeller, hvor det muliggør modeller med hundredvis af milliarder parametre der stadig kan køre med overkommelige beregningsomkostninger.

Hvordan fungerer MoE?

Arkitekturen

En MoE-model er typisk bygget som en transformer med MoE-lag:

Standard transformer-lag:

Input → Attention → Feed-Forward Network (FFN) → Output

MoE transformer-lag:

Input → Attention → Router → [Ekspert 1, Ekspert 2, ... Ekspert N] → Kombiner → Output

Forskellen er at det monolitiske feed-forward network erstattes af mange mindre, specialiserede feed-forward networks (eksperterne) og en router der vælger hvilke der bruges.

Routeren (gating-mekanismen)

Routeren er et lille neuralt netværk der for hvert input-token beregner en sandsynlighed for hver ekspert. Typisk aktiveres de top-K eksperter (ofte K=2) med de højeste sandsynligheder:

Input-token → Router → Sandsynligheder: [E1: 0.35, E2: 0.28, E3: 0.15, E4: 0.12, ...]
                       → Vælg top-2: E1 og E2
                       → Vægtede output: 0.35 × E1(input) + 0.28 × E2(input)

Routeren lærer under træning hvilke eksperter der er bedst til hvilke typer input. Over tid specialiserer eksperterne sig naturligt: én ekspert kan blive god til matematik, en anden til kodning, en tredje til dansk sprog.

Eksperterne

Hver ekspert er et feed-forward network. Typisk med samme arkitektur som FFN i en standard transformer, men med sine egne unikke vægte. Eksperterne deler attention-lagene men har separate FFN-lag.

Eksempel med 8 eksperter og top-2 routing:

  • Total parametre: 8 × størrelsen af én ekspert (plus delte attention-lag)
  • Aktive parametre per token: 2 × størrelsen af én ekspert (plus delte attention-lag)
  • Beregningsbesparelse: ~4x sammenlignet med en tæt model af samme størrelse

MoE vs. tætte modeller

Tæt model (dense)MoE-model (sparse)
Aktive parametreAlle parametre bruges per tokenKun en delmængde bruges per token
Total parametre= aktive parametre» aktive parametre
Compute per tokenProportionalt med total parametreProportionalt med aktive parametre
HukommelsesbehovProportionalt med total parametreProportionalt med total parametre (alle skal i hukommelsen)
TræningshastighedLangsommere for samme kapacitetHurtigere for samme kapacitet
Inference-hastighedLangsommere for samme kapacitetHurtigere (færre beregninger)
Kvalitet per computeBaselineTypisk bedre

Den centrale afvejning: MoE-modeller er hurtigere at træne og køre for en given kvalitet, men de kræver mere hukommelse fordi alle eksperter skal kunne tilgås (selv om kun få bruges ad gangen).

Eksempler på MoE-modeller

Mixtral (Mistral AI)

Mixtral 8x7B var den første store open source MoE-sprogmodel:

  • 8 eksperter, hver med 7 milliarder parametre
  • Top-2 routing: 2 eksperter aktiveres per token
  • Total parametre: ~47 milliarder
  • Aktive parametre: ~13 milliarder per token
  • Performance: Matchede eller overgik Llama 2 70B (en tæt model med 70 milliarder parametre) med markant lavere compute

Mixtral demonstrerede at en MoE-model med 47B total parametre og 13B aktive parametre kunne matche en tæt model med 70B parametre. En markant effektivitetsforbedring.

GPT-4 (OpenAI)

Selvom OpenAI ikke har bekræftet detaljerne officielt, er det bredt rapporteret at GPT-4 bruger en MoE-arkitektur med mange eksperter. Det forklarer hvordan modellen kan have enorm kapacitet men stadig svare relativt hurtigt.

Gemini (Google)

Google’s Gemini-modeller bruger MoE-arkitektur. Google har lang erfaring med MoE via deres tidligere forskning (Switch Transformer, GShard).

DeepSeek-V3

DeepSeek’s V3-model bruger en avanceret MoE-arkitektur med fine-grained eksperter og innovativ routing, der opnår stærk performance til markant lavere træningsomkostninger end konkurrerende tætte modeller.

Llama 4 (Meta)

Metas Llama 4-modeller (Scout og Maverick, april 2025) bruger MoE-arkitektur. Scout har 16 eksperter med 17B aktive parametre og Maverick har 128 eksperter med 17B aktive parametre.

Grok (xAI)

xAI’s Grok-model bruger ligeledes MoE-arkitektur for at opnå høj kapacitet med effektiv inference.

Tekniske detaljer

Load balancing

Et centralt problem i MoE er at routeren kan lære at sende de fleste tokens til et par populære eksperter mens andre sjældent bruges. Det er ineffektivt (nogle eksperter overbelastes, andre er spildte) og reducerer modellens effektive kapacitet.

Løsninger:

  • Auxiliary loss: Et ekstra træningsmål der straffer ubalanceret routing. Tvinger routeren til at fordele tokens mere jævnt.
  • Expert capacity: En grænse for hvor mange tokens en ekspert kan håndtere per batch. Overskydende tokens sendes til andre eksperter.
  • Random routing: Tilføj tilfældighed til routingen under træning for at undgå at eksperter kollapser til identiske funktioner.

Token dropping

Når en ekspert modtager flere tokens end dens kapacitet tillader, kan overskydende tokens “droppes”. De processeres ikke af den ekspert. Det er en nødvendig mekanisme for effektivitet men kan påvirke kvaliteten.

Ekspert-specialisering

Over tid specialiserer eksperterne sig naturligt baseret på de tokens de modtager. Forskning har vist at eksperter i sprogmodeller kan specialisere sig efter:

  • Sprog: Eksperter der aktiveres primært for engelsk, kinesisk, kode, osv.
  • Domæne: Eksperter for videnskab, jura, matematik
  • Syntaktisk funktion: Eksperter for verber, substantiver, tegnsætning
  • Opgavetype: Eksperter for ræsonnering, faktahentning, kreativ skrivning

Denne emergente specialisering er en af grundene til at MoE-modeller er så effektive. I stedet for at alle parametre skal håndtere alle typer input, kan specialiserede parametre fokusere på det de er bedst til.

Fordele ved MoE

Mere kapacitet per compute

Den primære fordel. En MoE-model med 100B aktive parametre og 1T total parametre har kapaciteten af en trillion-parameter model men beregningsomkostningerne af en 100B model. Det muliggør større, mere kapable modeller inden for det samme compute-budget.

Hurtigere træning

For en given kvalitetsmålsætning kan en MoE-model trænes hurtigere end en tæt model, fordi den har mere kapacitet per beregning. Mixtral 8x7B kunne trænes til Llama 70B-kvalitet med en brøkdel af compute.

Hurtigere inference

Færre aktive parametre per token betyder hurtigere generering. Det er kritisk for brugeroplevelsen (hurtigere svar) og for økonomien (lavere inference-omkostninger per token).

Skalerbarhed

MoE skalerer godt. Man kan øge modellens kapacitet ved at tilføje flere eksperter uden proportionalt at øge compute per token. Det er en af de mest lovende veje til endnu mere kapable modeller.

Ulemper ved MoE

Hukommelsesbehov

Alle eksperter skal være tilgængelige i hukommelsen, selvom kun få bruges ad gangen. En MoE-model med 1T total parametre kræver hukommelse til 1T parametre, selvom den kun bruger 100B per token. Det kræver mange GPU’er.

Kommunikationsoverhead

I distribuerede systemer hvor eksperter er fordelt på flere GPU’er, skal tokens sendes til de GPU’er der hoster de valgte eksperter. Denne kommunikation kan blive en flaskehals.

Træningsstabilitet

MoE-modeller kan være sværere at træne stabilt end tætte modeller. Load balancing, expert collapse (eksperter der bliver identiske) og routing-instabilitet er reelle udfordringer.

Batch-effektivitet

Fordi forskellige tokens routes til forskellige eksperter, er beregningerne mindre regulære end i en tæt model. Det kan reducere hardware-udnyttelsen. GPU’er er mest effektive med ensartede beregninger.

Praktisk relevans

For AI-udviklere

MoE-arkitekturen påvirker modelvalg:

  • Mixtral og lignende tilbyder stærk performance til lavere inference-cost end tætte modeller af tilsvarende kvalitet
  • Self-hosting kræver mere GPU-hukommelse for MoE-modeller, men inference er hurtigere
  • Quantization kan reducere hukommelsesbehovet markant. En kvantiseret Mixtral 8x7B kan køre på en enkelt GPU

For virksomheder

MoE-modeller er ofte det bedste valg når:

  • Latens er vigtig: Hurtigere svar end tilsvarende tætte modeller
  • Pris per token er kritisk: Lavere compute per token = lavere API-pris
  • Self-hosting: Høj kvalitet er mulig med overkommelig hardware (efter kvantisering)

For slutbrugere

MoE er grunden til at moderne AI-modeller kan være både kraftfulde og hurtige. Uden MoE ville modeller som GPT-4 enten være langsommere, dyrere eller mindre kapable.

Ofte stillede spørgsmål

Hvad er Mixture of Experts (MoE)?

Mixture of Experts er en neural netværksarkitektur hvor modellen består af mange specialiserede undernetværk (eksperter) og en router der for hvert input vælger hvilke eksperter der skal aktiveres. I stedet for at bruge alle modellens parametre til hvert input bruges kun en delmængde, typisk 2 ud af 8 eller 16 eksperter. Det giver modellen stor samlet kapacitet men lavere beregningsomkostninger per token, hvilket muliggør større og mere kapable modeller uden proportionalt højere compute-krav.

Hvorfor er MoE bedre end en normal model?

MoE giver mere kvalitet per beregning. En MoE-model med 47 milliarder total parametre men kun 13 milliarder aktive per token kan matche en tæt model med 70 milliarder parametre i kvalitet, men med markant lavere compute-forbrug per token. Det betyder hurtigere svar, lavere pris og mulighed for at bygge endnu større modeller. Ulempen er højere hukommelsesbehov, alle parametre skal være tilgængelige selvom kun en brøkdel bruges ad gangen.

Hvilke AI-modeller bruger MoE?

Mange af de mest kapable moderne AI-modeller bruger MoE: Mixtral (Mistral AI) var den første store open source MoE-sprogmodel. GPT-4 (OpenAI), Gemini (Google), Llama 4 (Meta), DeepSeek-V3 og Grok (xAI) bruger alle MoE-arkitektur. Trenden bevæger sig klart mod MoE for de største og mest kapable modeller, fordi det er den mest effektive måde at skalere modelkapacitet på.

Hvad er forskellen på MoE og en sparse model?

MoE er den mest udbredte type af sparse model. En sparse model er enhver model hvor kun en delmængde af parametrene aktiveres per input, i modsætning til en tæt (dense) model hvor alle parametre bruges. MoE opnår sparsity via eksperter og routing. Andre tilgange til sparsity inkluderer pruning (fjernelse af unødvendige vægte) og structured sparsity (deaktivering af hele neuroner). I praksis bruges “sparse model” og “MoE-model” ofte synonymt i konteksten af store sprogmodeller.


Relaterede termer