Spring til indhold
AI Ordbog

AI Ordbog

ELO rating (for AI-modeller)

Et ratingsystem lånt fra skak der rangerer AI-modeller baseret på parvise sammenligninger, hvor rigtige brugere vælger den bedste model i blinde tests.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er ELO rating for AI-modeller?

ELO rating for AI-modeller er et system der rangerer AI-modeller baseret på menneskelige præferencer. I stedet for at teste modeller med automatiserede benchmarks lader man rigtige mennesker sammenligne to modellers svar (uden at vide hvilke modeller det er) og vælge det bedste. Resultaterne beregnes som en ELO-rating der afspejler modellens relative styrke.

Systemet er lånt direkte fra skak, hvor ELO-rating har været brugt siden 1960’erne til at rangere spillere. Princippet er enkelt: du optjener rating ved at slå modstandere med høj rating, og du taber rating ved at tabe til modstandere med lav rating. Over tid konvergerer ratingen mod spillerens (eller modellens) sande styrke.

For AI-modeller er ELO-rating blevet den mest respekterede kvalitetsmåling, fordi den fanger noget benchmarks ikke kan: hvad rigtige mennesker foretrækker.

Hvordan fungerer ELO-systemet?

Det matematiske grundlag

ELO-systemet beregner den forventede sandsynlighed for at spiller A slår spiller B baseret på deres ratings:

Forventet score for A = 1 / (1 + 10^((Rating_B - Rating_A) / 400))

Hvis A har rating 1300 og B har rating 1100:

  • Forventet score for A = 1 / (1 + 10^((1100-1300)/400)) = 0.76
  • A forventes at vinde 76% af gangene

Efter en kamp opdateres ratings:

  • Hvis A vinder (som forventet): A’s rating stiger lidt, B’s falder lidt
  • Hvis B vinder (overraskelse): B’s rating stiger meget, A’s falder meget

Jo mere overraskende resultatet er, jo større ratingændring. Det sikrer at ratings hurtigt konvergerer mod den sande styrke.

Skala og fortolkning

ELO-ratings har ingen fast øvre eller nedre grænse, men i praksis ligger AI-modeller typisk mellem 900 og 1400:

Rating-intervalBetydningEksempler (ca.)
1300+Absolut topklasseDe bedste frontier-modeller
1200-1300Meget stærkStærke proprietære modeller
1100-1200StærkGode open source-modeller, ældre frontier-modeller
1000-1100GennemsnitligMindre modeller, ældre modeller
Under 1000Under gennemsnittetSvagere eller meget gamle modeller

Ratingforskelle og vindersandsynlighed:

ForskelFavoritens vinderchance
0 point50% (lige stærke)
50 point57%
100 point64%
200 point76%
400 point91%

En forskel på 100 ELO-point er mærkbar men ikke dramatisk. En forskel på 400 point er massiv. Den stærkere model vinder over 9 ud af 10 gange.

Chatbot Arena: ELO i praksis

Hvordan det fungerer

Chatbot Arena, oprindeligt skabt af LMSYS Org ved UC Berkeley og nu drevet af det selvstændige selskab LMArena, er den primære platform for ELO-baseret AI-evaluering:

1. Brugeren stiller et spørgsmål: Enhver kan skrive et spørgsmål eller en opgave.

2. To anonyme modeller svarer: Brugeren ser to svar mærket “Model A” og “Model B” uden at vide hvilke modeller det er.

3. Brugeren stemmer: Valgmulighederne er:

  • A er bedre
  • B er bedre
  • Uafgjort
  • Begge er dårlige

4. Modellerne afsløres: Efter stemmen afsløres hvilke modeller der var A og B.

5. ELO opdateres: Begge modellers ratings justeres baseret på resultatet og den forventede score.

Hvorfor anonymitet er afgørende

Anonymiteten er central for systemets troværdighed. Hvis brugerne vidste at Model A var GPT-4 og Model B var en ukendt open source-model, ville mange vælge GPT-4 baseret på brand snarere end svarkvalitet. Blind evaluering tvinger brugerne til at vurdere selve svaret. Ikke afsenderen.

Skala

Chatbot Arena har indsamlet over fem millioner stemmer fra hundredtusinder af unikke brugere på tværs af mere end 400 modeller. Den store datamængde gør ratings statistisk robuste. Små udsving i individuelle stemmer udlignes af volumet.

Kategoriserede ELO-ratings

Chatbot Arena beregner ikke kun en overordnet rating men separate ratings for specifikke kapabiliteter:

Kodning: Hvor god er modellen til at skrive, debugge og forklare kode?

Matematik: Hvor præcis er modellen til matematisk ræsonnering?

Kreativ skrivning: Hvor engagerende og kreativ er modellen i skønlitterære og kreative opgaver?

Instruktionsfølgning: Hvor godt følger modellen komplekse, detaljerede instruktioner?

Hård prompt (svære opgaver): Hvordan klarer modellen sig på de sværeste, mest komplekse forespørgsler?

Multilingval: Hvordan performer modellen på andre sprog end engelsk?

Disse kategoriratings er ofte mere nyttige end den overordnede rating. En model kan have en samlet ELO på 1250 men en kodnings-ELO på 1300 og en kreativ-ELO på 1150. Vigtig information for en bruger der primært har brug for kodningshjælp.

ELO vs. benchmarks

ELO rating (Arena)Benchmarks (MMLU, etc.)
Hvem evaluererRigtige menneskerAutomatiserede tests
OpgaverFrie, varierede, virkeligeFaste, standardiserede
Hvad målesSubjektiv præferenceObjektiv korrekthed
Gaming-risikoLav (svært at game blinde tests)Højere (kontaminering, overoptimering)
DækningHvad brugere reelt spørger omForuddefinerede opgavetyper
Reproduc erbarhedStatistisk (baseret på mange stemmer)Eksakt (samme spørgsmål, samme svar)
SvaghedSubjektivt, bias i brugerpopulationMisser nuance, format-afhængigt

De to tilgange komplementerer hinanden. Benchmarks er gode til at måle specifikke, objektive kapabiliteter (matematik, fakta, kode). ELO-ratings fanger den bredere kvalitet af modellens svar som mennesker oplever den. Inklusive stil, hjælpsomhed, nuance og relevans der er svære at kvantificere i en benchmark.

Begrænsninger ved ELO for AI

Bruger-bias

Brugerne i Chatbot Arena er ikke et repræsentativt udsnit af befolkningen. De er overvejende teknisk orienterede, engelsktalende og har præferencer der ikke nødvendigvis matcher den bredere population. En model der scorer højt hos tech-brugere scorer ikke nødvendigvis højt hos en dansk virksomheds medarbejdere.

Præference vs. korrekthed

Brugere foretrækker ikke altid det mest korrekte svar. Et svar der er velskrevet, selvsikkert og detaljeret kan vinde over et kortere, mere korrekt svar. Modeller der er gode til at lyde overbevisende kan score højere end modeller der er gode til at være præcise.

Længde-bias

Forskning har vist at brugere i blinde tests har en tendens til at foretrække længere svar. Selv når det kortere svar er lige så godt eller bedre. Modeller der genererer verbose svar kan dermed opnå kunstigt høje ratings.

Positionsbias

I nogle evalueringer viser brugere en svag præference for det første svar (Model A) over det andet (Model B). Chatbot Arena kontrollerer for dette ved at randomisere rækkefølgen, men effekten er ikke helt elimineret.

Stikprøvestørrelse for nye modeller

En ny model der netop er tilføjet til Chatbot Arena har få stemmer og dermed en usikker rating. Det kræver typisk tusindvis af stemmer før ratingen stabiliserer sig. Tidlige ratings for nye modeller bør tages med forbehold.

Ikke alle opgaver er repræsenteret

Brugerne i Chatbot Arena stiller de spørgsmål de vil. Der er ingen garanti for at alle vigtige opgavetyper er dækket. Nichedomæner, specifikke sprog og specialiserede fagområder kan være underrepræsenterede.

ELO-rating i den bredere AI-evaluering

Fra skak til AI

ELO-systemet blev opfundet af den ungarsk-amerikanske fysiker Arpad Elo i 1960 til at rangere skakspillere. Det var et gennembrud fordi det gav en matematisk rigtig måde at beregne relativ styrke fra parvise sammenligninger.

Anvendelsen til AI-modeller er naturlig: ligesom skakspillere mødes i parvise kampe, mødes AI-modeller i parvise sammenligninger. Og ligesom en skakspillers rating konvergerer mod den sande styrke over mange kampe, konvergerer en AI-models rating over mange stemmer.

Varianter

Bradley-Terry-modellen: Den statistiske model der ligger til grund for Chatbot Arena’s beregninger. En generalisering af ELO der håndterer samtidige sammenligninger bedre.

Style-kontrollerede ratings: Chatbot Arena har introduceret ratings der kontrollerer for stilpræferencer (f.eks. længde, markdown-formatering) for at give en renere måling af indholdsqualitet.

Kategorispecifikke ratings: Separate ratings for kodning, matematik, kreativ skrivning osv. giver mere nuanceret information end en enkelt samlet rating.

Praktisk brug af ELO-ratings

For udviklere

ELO-ratings hjælper med at vælge den rigtige model:

  • Generel brug: Sortér efter overordnet ELO og vælg blandt top-modellerne
  • Specifik opgave: Brug kategoriserede ratings (kodning, matematik, etc.)
  • Budget-bevidst: Find modeller med høj ELO per krone. Ofte er den tredjebedste model markant billigere end den bedste
  • Open source: Filtrér efter open source-modeller og sammenlign deres ELO med proprietære alternativer

For virksomheder

ELO-ratings giver en hurtig indikation af modelkvalitet, men bør suppleres med egne tests:

  1. Indsnævre: Brug ELO til at identificere top-5 kandidater
  2. Teste: Evaluér kandidaterne på egne opgaver og data
  3. Afveje: Balancér kvalitet (ELO) med pris, hastighed, privatliv og support

For AI-forskere

ELO-ratings er en vigtig validering af nye modeller og teknikker. En ny models placering i Chatbot Arena er ofte mere troværdig end selvrapporterede benchmark-resultater.

Ofte stillede spørgsmål

Hvad er ELO rating for AI-modeller?

ELO rating for AI-modeller er et ratingsystem lånt fra skak der rangerer AI-modeller baseret på menneskelige præferencer i blinde sammenligninger. Rigtige brugere ser to anonyme modellers svar på det samme spørgsmål og vælger det bedste. Resultaterne beregnes som en numerisk rating der afspejler modellens relative styrke. Systemet bruges primært i Chatbot Arena (LMSYS) og anses for den mest pålidelige måling af AI-modelkvalitet, fordi det fanger hvad rigtige mennesker foretrækker.

Hvordan fortolker man ELO-ratings for AI?

ELO-ratings er relative. De viser styrkeforholdet mellem modeller. En forskel på 100 point betyder at den stærkere model vinder ca. 64% af sammenligningerne. En forskel på 200 point betyder 76% vinderchance. Små forskelle (under 30-50 point) er ofte ikke statistisk signifikante. De mest nyttige ratings er de kategoriserede. En models kodnings-ELO er mere relevant end den overordnede ELO hvis du primært har brug for kodningshjælp.

Hvorfor er ELO-ratings bedre end benchmarks?

ELO-ratings er ikke nødvendigvis bedre men komplementerer benchmarks. Benchmarks måler specifikke, objektive kapabiliteter under kontrollerede betingelser. ELO-ratings fanger den bredere brugeroplevelse: svarkvalitet, hjælpsomhed, stil og relevans der er svære at måle automatisk. ELO-ratings er også sværere at game fordi evalueringen er blind og udført af uafhængige brugere. Den stærkeste vurdering af en model kombinerer begge tilgange.

Hvilken AI-model har den højeste ELO-rating?

Topplaceringerne skifter løbende efterhånden som nye modeller lanceres. Generelt har de nyeste frontier-modeller fra OpenAI, Anthropic og Google de højeste overordnede ratings. Men rangeringen varierer markant efter kategori. En model kan toprangere i kodning men ligge lavere i kreativ skrivning. Tjek Chatbot Arena’s aktuelle leaderboard for de nyeste ratings, da de opdateres ugentligt med nye stemmer og modeller.


Relaterede termer