Spring til indhold
AI Ordbog

AI Ordbog

QLoRA

Fine-tuning af kvantiserede AI-modeller med minimal hukommelse.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er QLoRA?

QLoRA (Quantized LoRA) er en teknik der kombinerer kvantisering (komprimering af modellens tal) med LoRA (effektiv fine-tuning) for at muliggøre fine-tuning af store AI-modeller med ekstremt lav hukommelsesbrug. Det er som at få det bedste af to verdener: modellen er både komprimeret og tilpasselig.

QLoRA blev introduceret af Tim Dettmers og kolleger i 2023 og var et gennembrud fordi det gjorde fine-tuning af 65B-parameter modeller muligt på en enkelt 48 GB GPU. Noget der tidligere krævede en hel serverklynge. For mindre modeller er det endnu mere tilgængeligt: en 7B-model kan fine-tunes med QLoRA på en GPU med blot 6 GB hukommelse.

Hvordan fungerer QLoRA?

QLoRA bygger på tre innovationer:

  1. 4-bit NormalFloat (NF4). En specialdesignet kvantiseringsmetode der er optimeret til neurale netværks vægtfordelinger. Base-modellen kvantiseres til 4-bit, hvilket reducerer hukommelsesbehovet med ca. 75% sammenlignet med 16-bit.
  2. Double quantization. Selve kvantiseringsparametrene kvantiseres også, hvilket sparer yderligere hukommelse.
  3. Paged optimizers. Bruger CPU-hukommelse som backup når GPU-hukommelse løber tør, så lange sekvenser kan håndteres uden hukommelsesfejl.

Processen: base-modellen komprimeres til 4-bit og fryses. LoRA-adaptere tilføjes i 16-bit præcision og er de eneste parametre der trænes. Under forward pass dekomprimeres nødvendige dele af base-modellen midlertidigt til 16-bit for beregningen.

QLoRA vs. LoRA

  1. Base-model præcision. LoRA bruger modellen i 16-bit. QLoRA kvantiserer den til 4-bit. QLoRA kræver dermed markant mindre hukommelse.
  2. Hukommelsesbrug. Fine-tuning af en 7B-model: LoRA ~8 GB, QLoRA ~6 GB. For en 70B-model: LoRA ~80 GB (kræver multi-GPU), QLoRA ~48 GB (én GPU).
  3. Kvalitet. QLoRA matcher LoRA’s kvalitet i de fleste tilfælde, trods den aggressive komprimering af base-modellen.
  4. Hastighed. QLoRA er lidt langsommere end LoRA pga. dekomprimering under beregning, men forskellen er typisk 10-20%.

QLoRA i praksis

  1. Lokal fine-tuning. Fine-tune en 13B-model på en RTX 3090 (24 GB) eller en 7B-model på en RTX 3060 (12 GB). Tidligere krævede dette enterprise-hardware.
  2. Open source-community. QLoRA har skabt en eksplosion af fine-tunede modeller i open source-communityet. Tusindvis af specialiserede modeller er bygget med QLoRA og delt på Hugging Face.
  3. Domænetilpasning. Virksomheder bruger QLoRA til at tilpasse open source-modeller til specifikke brancher og opgaver med minimal hardware.
  4. Forskning. Forskere der ikke har adgang til dyre GPU-klynger kan eksperimentere med store modeller takket være QLoRA.

Demokratisering af fine-tuning Før QLoRA var fine-tuning af modeller med over 13 milliarder parametre forbeholdt virksomheder med dyre GPU-klynger. QLoRA har gjort det muligt for studerende, hobbyister og små virksomheder at fine-tune avancerede modeller. Det har skabt et blomstrende økosystem af specialiserede modeller.


FAQ

Hvad er QLoRA?

QLoRA (Quantized LoRA) er en fine-tuning-teknik der kombinerer 4-bit kvantisering med LoRA-adaptere. Det reducerer hukommelseskravet markant og gør det muligt at fine-tune store modeller på billig hardware, f.eks. en 7B-model på en standard gaming-GPU.

Hvad er forskellen på QLoRA og LoRA?

LoRA fine-tuner med modellen i fuld præcision (16-bit). QLoRA kvantiserer base-modellen til 4-bit først, hvilket reducerer hukommelsesbehovet med ca. 50-75%. Kvaliteten er næsten identisk, men QLoRA kræver markant mindre GPU-hukommelse.

Hvad har jeg brug for for at bruge QLoRA?

En GPU med mindst 6-8 GB hukommelse (f.eks. en RTX 3060) for 7B-modeller, eller 24 GB (RTX 3090/4090) for 13B-modeller. Software som Hugging Face PEFT, Axolotl eller Unsloth understøtter QLoRA out of the box.


Relaterede termer