Spring til indhold
AI Ordbog

AI Ordbog

LoRA (Low-Rank Adaptation)

Effektiv fine-tuning-teknik der kun træner en lille del af modellens parametre.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er LoRA?

LoRA (Low-Rank Adaptation) er en teknik der gør det muligt at fine-tune store AI-modeller ved kun at træne en lille mængde nye parametre i stedet for alle modellens milliarder af parametre. Det er som at tilføje en lille noter i marginen af en stor lærebog i stedet for at omskrive hele bogen.

LoRA blev introduceret af Microsoft Research i 2021 og er hurtigt blevet den mest populære teknik til at fine-tune store modeller. Hvor fuld fine-tuning af en 7B-model kræver 28+ GB GPU-hukommelse, kan LoRA gøre det med under 8 GB. På en standard gaming-GPU.

Resultatet er at fine-tuning (der tidligere var forbeholdt virksomheder med dyre serverklynger) nu er tilgængeligt for enkeltpersoner med en standard computer. LoRA har gjort tilpasning af AI-modeller tilgængelig for alle.

Hvordan fungerer LoRA?

Kernen i LoRA er en matematisk observation:

  1. Frys originalmodellen. Alle den præ-trænede models parametre fryses. De ændres ikke under fine-tuning.
  2. Tilføj lave rang-matricer. For hvert lag i modellen tilføjes to små matricer (A og B) der multipliceres sammen. Produktet A×B er en lille opdatering til lagets vægte.
  3. Træn kun de nye matricer. Kun A og B-matricerne trænes. De er markant mindre end de originale lag. Typisk kun 0,1-1% af modellens samlede parametre.
  4. Kombiner ved inference. Når modellen bruges, adderes LoRA-opdateringerne til de originale vægte. Resultatet er en tilpasset model med minimal overhead.

“Low-rank” refererer til at opdateringsmatricerne har lav rang. De komprimerer de vigtige ændringer ned i langt færre tal end det fulde lag. Forskning viser at de ændringer der sker under fine-tuning typisk har lav rang, hvilket gør LoRA matematisk velbegrundet.

Fordele ved LoRA

  1. Dramatisk reduceret hukommelsesbrug. Fine-tuning af et 7B-model med LoRA kræver 4-8 GB GPU-hukommelse i stedet for 28+ GB.
  2. Hurtigere træning. Færre parametre at opdatere = hurtigere træning. LoRA fine-tuning kan tage minutter til timer i stedet for dage.
  3. Modulært. LoRA-adaptere er separate filer (typisk nogle hundrede MB) der kan skiftes ud. Du kan have flere LoRA-adaptere til forskellige opgaver ovenpå den samme base-model.
  4. Kvalitet. LoRA matcher ofte fuld fine-tuning i kvalitet, trods at den kun træner en brøkdel af parametrene.
  5. Ingen katastrofisk glemsel. Fordi original-modellen er frosset, bevares al dens eksisterende viden intakt.

LoRA i praksis

  1. LLM-tilpasning. Fine-tune Llama eller Mistral til din virksomheds specifikke behov med LoRA på en standard GPU. Populære frameworks som Hugging Face PEFT og Axolotl har LoRA indbygget.
  2. Stable Diffusion. LoRA er ekstremt populær i Stable Diffusion-communityet. Kunstnere laver LoRA-adaptere der tilføjer specifikke stilarter, karakterer eller koncepter til billedgenereringsmodellen.
  3. Kodningsmodeller. Fine-tune en model til dit programmeringssprog eller din kodebase med LoRA.
  4. Sprogtilpasning. Fine-tune en primært engelsk model til bedre dansk eller andet sprog-support.

Rank-parameteren LoRA har en nøgle-hyperparameter: rank (r). En rank på 8 eller 16 bruges typisk. Højere rank = flere trænbare parametre = bedre tilpasningsevne men mere hukommelse. Lav rank = mindre og hurtigere men potentielt lavere kvalitet. For de fleste opgaver er rank 16-32 en god balance.


FAQ

Hvad er LoRA?

LoRA (Low-Rank Adaptation) er en parametereffektiv fine-tuning-teknik der tilpasser store AI-modeller ved kun at træne en lille mængde nye parametre (typisk under 1% af totalen). Det reducerer hukommelsesbrug og træningstid dramatisk og gør fine-tuning tilgængeligt på standard hardware.

Hvad er forskellen på LoRA og fuld fine-tuning?

Fuld fine-tuning opdaterer alle modellens parametre og kræver enorm hukommelse. LoRA fryser modellen og tilføjer små trænbare matricer, typisk under 1% af parametrene. LoRA bruger markant mindre hukommelse, er hurtigere og matcher ofte fuld fine-tunings kvalitet.

Hvad er forskellen på LoRA og QLoRA?

LoRA fine-tuner med den originale models præcision (typisk 16-bit). QLoRA kombinerer LoRA med 4-bit kvantisering, så base-modellen komprimeres yderligere. QLoRA kræver endnu mindre hukommelse og gør det muligt at fine-tune større modeller på billigere hardware.


Relaterede termer