Spring til indhold
AI Ordbog

AI Ordbog

MMLU

Massive Multitask Language Understanding. En af de mest citerede benchmarks der tester AI-modellers viden og forståelse på tværs af 57 fagområder.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er MMLU?

MMLU (Massive Multitask Language Understanding) er en benchmark der tester AI-modellers viden og forståelse på tværs af 57 forskellige fagområder. Den blev introduceret i 2020 af Dan Hendrycks et al. og er siden blevet den mest refererede benchmark for at vurdere store sprogmodellers generelle kapabilitet.

Benchmarken består af over 14.000 flervalgsopgaver fordelt på fag som matematik, fysik, historie, jura, medicin, filosofi, økonomi, computervidenskab og mange flere. Idéen er enkel: hvis en AI-model virkelig forstår sprog og har bred viden, bør den kunne svare korrekt på spørgsmål på tværs af mange fagområder. Ligesom en velstuderet generalist.

MMLU er blevet den de facto standard for at sammenligne sprogmodeller. Når OpenAI lancerer en ny GPT, Anthropic lancerer en ny Claude eller Google lancerer en ny Gemini, er MMLU-scoren næsten altid en af de første metrics der rapporteres.

Hvordan fungerer MMLU?

Opgaveformat

Alle MMLU-opgaver er flervalg med fire svarmuligheder (A, B, C, D). Modellen skal vælge det korrekte svar:

Eksempel fra abstrakt algebra:

Spørgsmål: Find ordenen af elementet 3 i den multiplikative gruppe Z*_7.

A) 2
B) 3
C) 6
D) 7

Eksempel fra jura:

Spørgsmål: En person underskriver en kontrakt under tvang.
Kontrakten er:

A) Gyldig og bindende
B) Ugyldig (void)
C) Omstødelig (voidable) af den tvungne part
D) Omstødelig af begge parter

Eksempel fra medicinsk genetik:

Spørgsmål: Huntingtons sygdom nedarves som en:

A) Autosomal recessiv tilstand
B) Autosomal dominant tilstand
C) X-bundet recessiv tilstand
D) Mitokondriel tilstand

De 57 fagområder

MMLU dækker fire overordnede kategorier:

STEM (naturvidenskab, teknologi, ingeniørvidenskab, matematik): Abstrakt algebra, astronomi, college biologi, college kemi, college computervidenskab, college fysik, college matematik, computernetværk, elektroteknik, elementær matematik, high school biologi, high school kemi, high school computervidenskab, high school fysik, high school matematik, high school statistik, maskinlæring, conceptual physics

Humaniora: Forhistorie, filosofi, high school europæisk historie, high school geografi, high school regering og politik, high school makroøkonomi, high school mikroøkonomi, high school psykologi, high school US historie, high school verdenshistorie, international jura, jurisprudence, logisk fejlslutning, moralfilosofi, verdensreligioner

Samfundsvidenskab: Econometrics, high school psykologi, human sexuality, markedsføring, offentlig forvaltning, professionel regnskab, professionel jura, professionel medicin, professionel psykologi, sociologi, US udenrigspolitik

Andet: Business etik, clinical knowledge, college medicin, global fakta, human aging, management, medicinsk genetik, ernæring, virology

Sværhedsgrader

Opgaverne spænder fra elementært niveau (high school) til ekspertniveau (professionel og college). Det gør MMLU til en bred test der fanger både grundlæggende viden og dybere forståelse:

NiveauEksempel-fagTypisk sværhed
High schoolBiologi, matematik, historieGenerel almen viden
CollegeFysik, kemi, computervidenskabUniversitetsniveau
ProfessionelJura, medicin, regnskabFagsspecialist-niveau

Evalueringssetup

MMLU testes typisk i to formater:

Zero-shot: Modellen får kun spørgsmålet og svarmulighederne. Ingen eksempler. Tester modellens evne til at svare uden hjælp.

5-shot: Modellen får fem eksempler med korrekte svar inden for samme fagområde, før den får testspørgsmålet. Det giver modellen kontekst for formatet og fagområdet.

Scoren rapporteres som procent korrekte (accuracy). Tilfældig gætning giver 25% (fire svarmuligheder).

MMLU-scorer over tid

MMLU’s historie viser AI-fremskridtets hastighed:

ÅrBedste modelCa. MMLU-score
2020GPT-3~43%
2022Chinchilla, PaLM~68-70%
2023GPT-4~86%
2024Claude, GPT-4o~88-90%
2025Frontier-modeller~90%+

Menneskeligt niveau: Eksperter inden for deres eget fagområde scorer typisk omkring 90%. Generalister scorer lavere. Ingen enkeltperson er ekspert i alle 57 fag.

Udviklingen fra 43% i 2020 til over 90% i 2025 er bemærkelsesværdig. Det der for fem år siden var en udfordrende test, er nu nær-satureret for de bedste modeller.

MMLU-Pro: Den sværere version

Fordi MMLU er ved at være satureret (de bedste modeller scorer alle over 85-90%), blev MMLU-Pro introduceret som en sværere variant:

Forskelle fra MMLU:

MMLUMMLU-Pro
Svarmuligheder4 (A-D)10 (A-J)
Gættebaseline25%10%
OpgavekompleksitetBlandetPrimært svære
Ræsonnering krævetVarierendeKonsekvent multi-step
SatureringNæsten satureretStadig differentierende

MMLU-Pro er designet til at differentiere mellem de stærkeste modeller. Med 10 svarmuligheder er det langt sværere at gætte sig til det rigtige svar, og opgaverne kræver mere avanceret ræsonnering.

Typiske MMLU-Pro-scorer (2025): 60-75% for de bedste modeller. Markant lavere end MMLU og dermed mere informativt om modellernes relative styrke.

Hvorfor er MMLU vigtig?

Standardiseret sammenligning

MMLU giver et fælles sammenligningsgrundlag. Når Model A scorer 88% og Model B scorer 85%, har vi et konkret, reproducer bart tal at diskutere. I stedet for subjektive vurderinger som “den ene føles smartere.”

Bred dækning

Med 57 fagområder tester MMLU ikke bare én kapabilitet men bred viden. En model kan score højt på matematik men lavt på jura. MMLU afslører det. Det giver et mere nuanceret billede end en enkelt-domæne-test.

Historisk sporbarhed

Fordi MMLU har været brugt siden 2020, giver den en unik tidsserie der dokumenterer AI-fremskridt. Stigningen fra 43% til 90%+ på fem år er et af de mest konkrete mål for, hvor hurtigt sprogmodeller er blevet bedre.

Signalværdi

For modeludviklere er MMLU-scoren et centralt salgsargument. For virksomheder er det en hurtig indikator for modelkvalitet. Det er ikke det eneste relevante tal, men det er ofte det første man kigger på.

Begrænsninger ved MMLU

Flervalgsformat

MMLU tester kun flervalg. I virkeligheden skal AI-modeller formulere egne svar, skrive tekst, generere kode og løse åbne problemer. En model kan være god til at vælge mellem fire alternativer men dårlig til at producere et svar fra bunden.

Flervalgsformatet giver også mulighed for elimineringsstrategier. Modellen kan udelukke åbenlyst forkerte svar og gætte mellem de resterende, uden nødvendigvis at forstå det korrekte svar.

Saturering

Med de bedste modeller over 90% kan MMLU ikke længere differentiere mellem topmodeller. Forskellen mellem 89% og 91% er minimal og kan skyldes tilfældigheder snarere end reel kvalitetsforskel. Derfor er MMLU-Pro og andre sværere benchmarks blevet nødvendige.

Kontaminering

MMLU’s opgaver har været offentligt tilgængelige siden 2020. Der er en reel risiko for at modeller har set opgaverne (eller meget lignende opgaver) under træning. Bevidst eller ubevidst. Hvis en model har memoreret svaret til et MMLU-spørgsmål, tester spørgsmålet memorering, ikke forståelse.

Forskning har vist at flere modeller scorer kunstigt højt på opgaver der optræder i deres træningsdata. Kontaminering er et generelt problem for benchmarks, men det er særligt relevant for MMLU på grund af dens alder og udbredelse.

Vestligt og engelsk centreret

MMLU er på engelsk og afspejler primært vestlig, anglofon akademisk viden. Den tester ikke viden om dansk lovgivning, skandinavisk historie eller europæisk erhvervsret. En model der scorer 90% på MMLU er ikke nødvendigvis lige så stærk på dansksprogede opgaver inden for danske fagområder.

Statisk datasæt

MMLU’s opgaver ændrer sig ikke. Viden fra efter 2020 er ikke repræsenteret i benchmarken. En model der kender til begivenheder efter 2020 (fordi den er trænet på nyere data) har en implicit fordel. Men MMLU tester ikke den nyere viden.

Overfladisk forståelse

Flervalgsformat tester om modellen kan vælge det rigtige svar, ikke om den forstår hvorfor svaret er rigtigt. En model kan score højt på MMLU via mønstergenkendelse og statistiske korrelationer uden dyb konceptuel forståelse.

MMLU i praksis

For modeludviklere

MMLU er en obligatorisk benchmark. Enhver ny sprogmodel rapporterer sin MMLU-score, og den bruges til at positionere modellen i markedet. En model der scorer under 80% på MMLU vil have svært ved at blive taget seriøst som en frontier-model.

Typisk brug: Rapportér MMLU-score i lanceringsmateriale. Opdel scoren i kategorier (STEM, humaniora, samfundsvidenskab) for at vise styrker. Sammenlign med konkurrenter.

For virksomheder

MMLU giver en hurtig indikation af modelkvalitet, men bør aldrig være det eneste evalueringskriterie:

  1. Screening: Brug MMLU til at identificere modeller med tilstrækkelig generel kapabilitet
  2. Kategori-scores: Kig på scores inden for relevante fagområder (f.eks. jura for en juridisk applikation)
  3. Supplér: Test altid modellen på egne opgaver. MMLU-scorer oversættes ikke direkte til performance på specifikke business-opgaver

For forskere

MMLU er en baseline-benchmark der inkluderes i næsten alle evalueringer af nye sprogmodeller eller teknikker. Den giver en standardiseret reference der gør det muligt at sammenligne resultater på tværs af forskningsgrupper og publikationer.

MMLU vs. andre benchmarks

BenchmarkFokusFormatStatus (2025)
MMLUBred viden (57 fag)Flervalg (4 svar)Nær-satureret
MMLU-ProSværere bred videnFlervalg (10 svar)Differentierende
HumanEvalKodegenereringÅben (skriv kode)Nær-satureret
MATHKonkurrencematematikÅben (beregn svar)Stadig udfordrende
SWE-benchSoftwareudviklingÅben (skriv patches)Meget udfordrende
Chatbot ArenaBrugerbaseret kvalitetParvis sammenligningDynamisk

MMLU komplementerer andre benchmarks. Den tester bred viden men ikke kodning, kreativitet eller brugeroplevelse. Den bedste vurdering af en model kombinerer MMLU med opgavespecifikke benchmarks og arena-baserede evalueringer.

Ofte stillede spørgsmål

Hvad er MMLU?

MMLU (Massive Multitask Language Understanding) er en benchmark der tester AI-modellers viden og forståelse på tværs af 57 fagområder via over 14.000 flervalgsopgaver. Fagområderne spænder fra elementær matematik og biologi til avanceret jura, medicin og filosofi. MMLU er den mest citerede benchmark for store sprogmodeller og bruges af stort set alle modeludviklere til at dokumentere og sammenligne præstationer. Scoren rapporteres som procent korrekte svar, hvor tilfældig gætning giver 25%.

Hvad er en god MMLU-score?

I 2025 scorer de bedste frontier-modeller over 90% på MMLU, mens menneskeeksperter scorer omkring 90% inden for deres egne fagområder. En score over 85% betragtes som stærk, 70-85% som god men ikke førende, og under 70% som markant under state of the art. Forskelle under 2-3 procentpoint er sjældent statistisk signifikante. For mere differentiering mellem topmodeller bruges MMLU-Pro, hvor de bedste modeller scorer 60-75%.

Hvorfor er MMLU ved at være forældet?

MMLU er nær-satureret. De bedste modeller scorer alle over 85-90%, så benchmarken kan ikke længere differentiere mellem dem. Derudover er opgaverne offentligt tilgængelige siden 2020, hvilket øger risikoen for datakontaminering. Flervalgsformatet tester heller ikke modellernes evne til at formulere egne svar. Derfor er MMLU-Pro, LiveBench og andre nyere benchmarks blevet nødvendige supplementer. MMLU er dog stadig nyttig som en standardiseret basislinje og til at spore historisk fremskridt.

Hvad er forskellen på MMLU og MMLU-Pro?

MMLU har 4 svarmuligheder per spørgsmål (gættebaseline 25%), mens MMLU-Pro har 10 svarmuligheder (gættebaseline 10%). MMLU-Pro indeholder også sværere opgaver der konsekvent kræver multi-step ræsonnering. De bedste modeller scorer over 90% på MMLU men kun 60-75% på MMLU-Pro, hvilket gør MMLU-Pro langt bedre til at differentiere mellem topmodeller. MMLU-Pro blev introduceret som svar på at MMLU var ved at nå sin grænse som differentierende benchmark.


Relaterede termer