AI Ordbog
Distillation (model distillation)
Teknik til at komprimere en stor AI-models viden ind i en mindre model.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er model distillation?
Model distillation (vidensdestillation på dansk) er en teknik hvor en stor, kraftfuld AI-model bruges til at træne en mindre model. Den store model kaldes “læreren” (teacher), den lille model “eleven” (student). Eleven lærer at efterligne lærerens output og opnår dermed en stor del af lærerens kapabilitet i en brøkdel af størrelsen.
Tænk på det som at destillere whisky: du starter med en stor mængde rå væske og ender med en lille mængde koncentreret essens. Model distillation komprimerer hundredvis af milliarder parametres viden ned til nogle få milliarder. Med overraskende lidt tab.
Begrebet blev populariseret af Geoffrey Hinton i 2015 og er i dag en af de vigtigste teknikker til at gøre AI praktisk. Mange af de AI-modeller du bruger dagligt (i din telefon, din browser, dine apps) er destillerede versioner af langt større modeller.
Hvordan fungerer distillation?
- Lærerens output. Den store model producerer ikke bare hårde svar (“kat” eller “hund”), men også sandsynlighedsfordelinger. F.eks. “80% kat, 15% los, 5% hund.” Disse “bløde” outputs indeholder langt mere information end hårde labels.
- Eleven lærer. Den lille model trænes til at matche lærerens sandsynlighedsfordelinger, ikke bare de korrekte svar. Det giver eleven adgang til lærerens nuancerede forståelse af sammenhænge mellem klasser.
- Temperature scaling. Lærens sandsynlighedsfordelinger “blødgøres” ved at øge temperaturen, så forskellen mellem de mest og mindst sandsynlige svar reduceres. Det gør de bløde labels mere informative.
Hvorfor virker distillation?
Den lille model lærer mere fra den store models output end den ville lære fra de originale data alene, fordi:
- Mørk viden. Lærerens output indeholder information der ikke er i de hårde labels. At en model siger “80% kat, 15% los” fortæller eleven at katte og losser ligner hinanden. Viden der ikke er i det hårde label “kat.”
- Regularisering. Lærerens bløde output fungerer som en form for regularisering der hjælper eleven med at generalisere bedre.
- Effektiv læring. Eleven lærer fra lærerens destillerede forståelse i stedet for at skulle udlede alt fra rå data.
Distillation i praksis
- LLM-distillation. Metas Llama-modeller er delvist destilleret fra større modeller. OpenAI’s GPT-4o mini er en destilleret version af GPT-4o. Microsofts Phi-modeller bruger destillering intensivt.
- Edge-deployment. Store modeller der kører i skyen destilleres til versioner der kan køre på telefoner, tablets og IoT-enheder. Apple Intelligence bruger destillerede on-device modeller.
- Hastighed. Real-time applikationer som autocomplete, talegenkendelse og billedklassifikation bruger destillerede modeller der svarer på millisekunder i stedet for sekunder.
- Omkostningsreduktion. Virksomheder med millioner af API-kald kan spare enormt ved at erstatte dyre lærermodeller med billige, destillerede elevmodeller for opgaver der ikke kræver maksimal kapabilitet.
Lærer-elev-dynamik Det mest overraskende ved distillation er hvor lidt eleven taber sammenlignet med læreren. En elev-model med 10x færre parametre kan typisk bevare 90-95% af lærerens præstation. Det skyldes at store modeller er “overparameteriserede”. De har langt flere parametre end strengt nødvendigt, og den vigtigste viden kan komprimeres markant.
FAQ
Hvad er model distillation?
Model distillation er en teknik hvor en stor AI-model (lærer) bruges til at træne en mindre model (elev), så eleven bevarer meget af lærerens kapabilitet i en brøkdel af størrelsen. Det bruges til at gøre AI-modeller hurtigere, billigere og kørbare på begrænsede enheder.
Hvad er forskellen på distillation og fine-tuning?
Fine-tuning tilpasser en model til en specifik opgave med specialiserede data. Distillation komprimerer en stor models viden ind i en mindre model. Målet med fine-tuning er specialisering, målet med distillation er effektivisering. De kan dog kombineres. Man kan destillere og fine-tune i samme proces.
Kan man destillere enhver model?
I princippet ja, men kvaliteten afhænger af forskellen i størrelse mellem lærer og elev. En elev der er 2-5x mindre end læreren kan typisk bevare det meste af præstationen. En elev der er 100x mindre vil miste markant kapabilitet.