AI Ordbog
QLoRA
Fine-tuning af kvantiserede AI-modeller med minimal hukommelse.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er QLoRA?
QLoRA (Quantized LoRA) er en teknik der kombinerer kvantisering (komprimering af modellens tal) med LoRA (effektiv fine-tuning) for at muliggøre fine-tuning af store AI-modeller med ekstremt lav hukommelsesbrug. Det er som at få det bedste af to verdener: modellen er både komprimeret og tilpasselig.
QLoRA blev introduceret af Tim Dettmers og kolleger i 2023 og var et gennembrud fordi det gjorde fine-tuning af 65B-parameter modeller muligt på en enkelt 48 GB GPU. Noget der tidligere krævede en hel serverklynge. For mindre modeller er det endnu mere tilgængeligt: en 7B-model kan fine-tunes med QLoRA på en GPU med blot 6 GB hukommelse.
Hvordan fungerer QLoRA?
QLoRA bygger på tre innovationer:
- 4-bit NormalFloat (NF4). En specialdesignet kvantiseringsmetode der er optimeret til neurale netværks vægtfordelinger. Base-modellen kvantiseres til 4-bit, hvilket reducerer hukommelsesbehovet med ca. 75% sammenlignet med 16-bit.
- Double quantization. Selve kvantiseringsparametrene kvantiseres også, hvilket sparer yderligere hukommelse.
- Paged optimizers. Bruger CPU-hukommelse som backup når GPU-hukommelse løber tør, så lange sekvenser kan håndteres uden hukommelsesfejl.
Processen: base-modellen komprimeres til 4-bit og fryses. LoRA-adaptere tilføjes i 16-bit præcision og er de eneste parametre der trænes. Under forward pass dekomprimeres nødvendige dele af base-modellen midlertidigt til 16-bit for beregningen.
QLoRA vs. LoRA
- Base-model præcision. LoRA bruger modellen i 16-bit. QLoRA kvantiserer den til 4-bit. QLoRA kræver dermed markant mindre hukommelse.
- Hukommelsesbrug. Fine-tuning af en 7B-model: LoRA ~8 GB, QLoRA ~6 GB. For en 70B-model: LoRA ~80 GB (kræver multi-GPU), QLoRA ~48 GB (én GPU).
- Kvalitet. QLoRA matcher LoRA’s kvalitet i de fleste tilfælde, trods den aggressive komprimering af base-modellen.
- Hastighed. QLoRA er lidt langsommere end LoRA pga. dekomprimering under beregning, men forskellen er typisk 10-20%.
QLoRA i praksis
- Lokal fine-tuning. Fine-tune en 13B-model på en RTX 3090 (24 GB) eller en 7B-model på en RTX 3060 (12 GB). Tidligere krævede dette enterprise-hardware.
- Open source-community. QLoRA har skabt en eksplosion af fine-tunede modeller i open source-communityet. Tusindvis af specialiserede modeller er bygget med QLoRA og delt på Hugging Face.
- Domænetilpasning. Virksomheder bruger QLoRA til at tilpasse open source-modeller til specifikke brancher og opgaver med minimal hardware.
- Forskning. Forskere der ikke har adgang til dyre GPU-klynger kan eksperimentere med store modeller takket være QLoRA.
Demokratisering af fine-tuning Før QLoRA var fine-tuning af modeller med over 13 milliarder parametre forbeholdt virksomheder med dyre GPU-klynger. QLoRA har gjort det muligt for studerende, hobbyister og små virksomheder at fine-tune avancerede modeller. Det har skabt et blomstrende økosystem af specialiserede modeller.
FAQ
Hvad er QLoRA?
QLoRA (Quantized LoRA) er en fine-tuning-teknik der kombinerer 4-bit kvantisering med LoRA-adaptere. Det reducerer hukommelseskravet markant og gør det muligt at fine-tune store modeller på billig hardware, f.eks. en 7B-model på en standard gaming-GPU.
Hvad er forskellen på QLoRA og LoRA?
LoRA fine-tuner med modellen i fuld præcision (16-bit). QLoRA kvantiserer base-modellen til 4-bit først, hvilket reducerer hukommelsesbehovet med ca. 50-75%. Kvaliteten er næsten identisk, men QLoRA kræver markant mindre GPU-hukommelse.
Hvad har jeg brug for for at bruge QLoRA?
En GPU med mindst 6-8 GB hukommelse (f.eks. en RTX 3060) for 7B-modeller, eller 24 GB (RTX 3090/4090) for 13B-modeller. Software som Hugging Face PEFT, Axolotl eller Unsloth understøtter QLoRA out of the box.