Spring til indhold
AI Ordbog

AI Ordbog

Quantization (kvantisering)

Teknik til at gøre AI-modeller mindre og hurtigere ved at reducere præcisionen af tal.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er quantization?

Quantization (kvantisering på dansk) er en teknik der gør AI-modeller mindre og hurtigere ved at reducere præcisionen af de tal modellen bruger. I stedet for at gemme hvert parameter som et 32-bit eller 16-bit decimaltal, konverteres det til et 8-bit, 4-bit eller endda 2-bit heltal.

Tænk på det som forskellen mellem at måle afstanden til månen med en millimeter-nøjagtighed og med meter-nøjagtighed. Meter-nøjagtighed er langt mindre data at gemme, og for de fleste formål er det rigeligt præcist. Quantization gør det samme med AI-modellens tal.

Resultatet er markant: en model med 7 milliarder parametre i 32-bit (FP32) kræver ca. 28 GB hukommelse. Kvantiseret til 4-bit kræver den kun ca. 3,5 GB. En reduktion på 8x. Det er forskellen mellem at kræve en dyr server-GPU og at køre på en standard laptop.

Hvordan fungerer quantization?

  1. Oprindelig præcision. AI-modeller trænes typisk med 32-bit (FP32) eller 16-bit (FP16/BF16) tal. Hvert parameter er et decimaltal med høj præcision som 0.00328756.
  2. Mapping. Parametrene mappes til et mindre antal mulige værdier. Med 8-bit har du 256 mulige værdier i stedet for milliarder. Med 4-bit har du kun 16 mulige værdier.
  3. Afvejning. Der er uundgåeligt et tab af præcision, men forskning viser at det ofte har minimal indvirkning på modellens kvalitet. Især for større modeller.

Typer af quantization

  1. Post-training quantization (PTQ). Kvantiserer en allerede trænet model uden yderligere træning. Simpelt og hurtigt, men kan give lidt kvalitetstab. Det mest brugte i praksis.
  2. Quantization-aware training (QAT). Modellen trænes med kvantisering i tankerne. Den lærer at kompensere for præcisionstabet under træning. Giver bedre resultater men kræver gen-træning.
  3. GPTQ. En populær PTQ-metode specifikt til sprogmodeller. Kvantiserer én lag ad gangen og minimerer fejlen.
  4. AWQ (Activation-aware Weight Quantization). Kvantiserer smartere ved at beskytte de vigtigste parametre med højere præcision.
  5. GGUF (llama.cpp format). Det populære format til kvantiserede modeller der bruges med Ollama og llama.cpp. Tilgængelig i forskellige kvantiseringsniveauer (Q4_K_M, Q5_K_M, Q8_0 osv.).

Kvantiseringsniveauer

  1. FP32 (32-bit). Fuld præcision. 4 bytes per parameter. Standard trænningspræcision.
  2. FP16/BF16 (16-bit). Halv præcision. 2 bytes per parameter. Standard for inference med minimal kvalitetstab.
  3. INT8 (8-bit). 1 byte per parameter. God balance mellem størrelse og kvalitet. Typisk <1% kvalitetstab.
  4. INT4 (4-bit). 0,5 bytes per parameter. Populær for lokal kørsel af store modeller. Mærkbart men acceptabelt kvalitetstab.
  5. INT2 (2-bit). 0,25 bytes per parameter. Aggressiv komprimering med tydeligt kvalitetstab. Bruges sjældent.

Quantization i praksis

  1. Lokal AI. Ollama, LM Studio og GPT4All bruger kvantiserede modeller til at køre LLM’er lokalt på din laptop. Et 4-bit kvantiseret Llama 3 8B kræver kun ~5 GB RAM.
  2. Mobilenheder. Apple Intelligence og on-device AI bruger kvantiserede modeller til at køre AI direkte på iPhones og iPads.
  3. Server-optimering. Virksomheder kvantiserer modeller til INT8 for at reducere serveromkostninger og øge throughput.
  4. Edge AI. IoT-enheder og embedded systems med begrænset hukommelse bruger aggressive kvantiseringsniveauer.

Større modeller tåler mere kvantisering Et overraskende resultat fra forskningen: større modeller tåler kvantisering bedre end mindre. Et 70B-parameter model kvantiseret til 4-bit præsterer ofte bedre end et 7B-parameter model i fuld præcision. Det skyldes at større modeller er mere redundante og har mere “overskud” der kan fjernes uden konsekvens.


FAQ

Hvad er quantization?

Quantization (kvantisering) er en teknik der gør AI-modeller mindre og hurtigere ved at reducere præcisionen af modellens tal, typisk fra 32-bit til 8-bit eller 4-bit. Det reducerer modellens størrelse markant med minimalt tab af kvalitet og gør det muligt at køre store modeller lokalt.

Hvor meget kvalitet mister man?

Det afhænger af modellens størrelse og kvantiseringsniveauet. 8-bit giver typisk under 1% kvalitetstab. 4-bit giver 1-3% tab. For de fleste praktiske opgaver er forskellen ubemærkelig. Større modeller tåler kvantisering bedre end mindre.

Kan man kvantisere enhver model?

Ja, i princippet. De fleste populære open source-modeller (Llama, Mistral, Qwen) er tilgængelige i kvantiserede versioner. Værktøjer som llama.cpp, GPTQ og AutoAWQ gør processen nem. Kvantiserede versioner i GGUF-format er bredt tilgængelige på Hugging Face.


Relaterede termer