AI Ordbog
LoRA (Low-Rank Adaptation)
Effektiv fine-tuning-teknik der kun træner en lille del af modellens parametre.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er LoRA?
LoRA (Low-Rank Adaptation) er en teknik der gør det muligt at fine-tune store AI-modeller ved kun at træne en lille mængde nye parametre i stedet for alle modellens milliarder af parametre. Det er som at tilføje en lille noter i marginen af en stor lærebog i stedet for at omskrive hele bogen.
LoRA blev introduceret af Microsoft Research i 2021 og er hurtigt blevet den mest populære teknik til at fine-tune store modeller. Hvor fuld fine-tuning af en 7B-model kræver 28+ GB GPU-hukommelse, kan LoRA gøre det med under 8 GB. På en standard gaming-GPU.
Resultatet er at fine-tuning (der tidligere var forbeholdt virksomheder med dyre serverklynger) nu er tilgængeligt for enkeltpersoner med en standard computer. LoRA har gjort tilpasning af AI-modeller tilgængelig for alle.
Hvordan fungerer LoRA?
Kernen i LoRA er en matematisk observation:
- Frys originalmodellen. Alle den præ-trænede models parametre fryses. De ændres ikke under fine-tuning.
- Tilføj lave rang-matricer. For hvert lag i modellen tilføjes to små matricer (A og B) der multipliceres sammen. Produktet A×B er en lille opdatering til lagets vægte.
- Træn kun de nye matricer. Kun A og B-matricerne trænes. De er markant mindre end de originale lag. Typisk kun 0,1-1% af modellens samlede parametre.
- Kombiner ved inference. Når modellen bruges, adderes LoRA-opdateringerne til de originale vægte. Resultatet er en tilpasset model med minimal overhead.
“Low-rank” refererer til at opdateringsmatricerne har lav rang. De komprimerer de vigtige ændringer ned i langt færre tal end det fulde lag. Forskning viser at de ændringer der sker under fine-tuning typisk har lav rang, hvilket gør LoRA matematisk velbegrundet.
Fordele ved LoRA
- Dramatisk reduceret hukommelsesbrug. Fine-tuning af et 7B-model med LoRA kræver 4-8 GB GPU-hukommelse i stedet for 28+ GB.
- Hurtigere træning. Færre parametre at opdatere = hurtigere træning. LoRA fine-tuning kan tage minutter til timer i stedet for dage.
- Modulært. LoRA-adaptere er separate filer (typisk nogle hundrede MB) der kan skiftes ud. Du kan have flere LoRA-adaptere til forskellige opgaver ovenpå den samme base-model.
- Kvalitet. LoRA matcher ofte fuld fine-tuning i kvalitet, trods at den kun træner en brøkdel af parametrene.
- Ingen katastrofisk glemsel. Fordi original-modellen er frosset, bevares al dens eksisterende viden intakt.
LoRA i praksis
- LLM-tilpasning. Fine-tune Llama eller Mistral til din virksomheds specifikke behov med LoRA på en standard GPU. Populære frameworks som Hugging Face PEFT og Axolotl har LoRA indbygget.
- Stable Diffusion. LoRA er ekstremt populær i Stable Diffusion-communityet. Kunstnere laver LoRA-adaptere der tilføjer specifikke stilarter, karakterer eller koncepter til billedgenereringsmodellen.
- Kodningsmodeller. Fine-tune en model til dit programmeringssprog eller din kodebase med LoRA.
- Sprogtilpasning. Fine-tune en primært engelsk model til bedre dansk eller andet sprog-support.
Rank-parameteren LoRA har en nøgle-hyperparameter: rank (r). En rank på 8 eller 16 bruges typisk. Højere rank = flere trænbare parametre = bedre tilpasningsevne men mere hukommelse. Lav rank = mindre og hurtigere men potentielt lavere kvalitet. For de fleste opgaver er rank 16-32 en god balance.
FAQ
Hvad er LoRA?
LoRA (Low-Rank Adaptation) er en parametereffektiv fine-tuning-teknik der tilpasser store AI-modeller ved kun at træne en lille mængde nye parametre (typisk under 1% af totalen). Det reducerer hukommelsesbrug og træningstid dramatisk og gør fine-tuning tilgængeligt på standard hardware.
Hvad er forskellen på LoRA og fuld fine-tuning?
Fuld fine-tuning opdaterer alle modellens parametre og kræver enorm hukommelse. LoRA fryser modellen og tilføjer små trænbare matricer, typisk under 1% af parametrene. LoRA bruger markant mindre hukommelse, er hurtigere og matcher ofte fuld fine-tunings kvalitet.
Hvad er forskellen på LoRA og QLoRA?
LoRA fine-tuner med den originale models præcision (typisk 16-bit). QLoRA kombinerer LoRA med 4-bit kvantisering, så base-modellen komprimeres yderligere. QLoRA kræver endnu mindre hukommelse og gør det muligt at fine-tune større modeller på billigere hardware.