Spring til indhold
AI Ordbog

AI Ordbog

Top-k sampling

Samplingsmetode der begrænser AI til de K mest sandsynlige tokens.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er top-k sampling?

Top-k sampling er en metode til at kontrollere AI-modellens output ved at begrænse valget til de K mest sandsynlige næste tokens. Hvis K er sat til 50, overvejer modellen kun de 50 mest sandsynlige tokens. Alle andre ignoreres, uanset deres sandsynlighed.

Det er en af de simpleste og mest intuitive metoder til at styre tilfældigheden i AI-output. Lav K (f.eks. 1-10) giver meget fokuserede, forudsigelige svar. Høj K (f.eks. 100-500) giver mere varierede og kreative svar.

Top-k sampling var en af de første samplingsmetoder der blev bredt brugt i sprogmodeller og er stadig en standardparameter i mange AI-API’er, selvom top-p (nucleus sampling) ofte foretrækkes i dag.

Hvordan fungerer top-k sampling?

  1. Modellen beregner en sandsynlighed for hvert token i sit ordforråd (typisk 32.000-200.000 tokens).
  2. Tokens sorteres efter sandsynlighed fra højest til lavest.
  3. Kun de top-K tokens beholdes. Alle andre sættes til sandsynlighed 0.
  4. Sandsynlighederne for de K tokens renormaliseres så de summer til 100%.
  5. Modellen sampler fra denne indsnævrede fordeling.

Med K=1 vælges altid det mest sandsynlige token. Det giver deterministisk output, identisk med temperature 0. Med K lig ordforrådet sker ingen filtrering. Alle tokens overvejes.

Top-k vs. top-p

Den vigtigste forskel er at K er fast, mens top-p er dynamisk:

  1. Fast vs. dynamisk. Top-k tager altid præcis K tokens, uanset konteksten. Top-p tager det varierende antal tokens der udgør P procent af sandsynligheden.
  2. Problem med top-k. Når modellen er meget sikker (ét token har 99% sandsynlighed), inkluderer top-k stadig K-1 næsten irrelevante tokens. Når modellen er usikker (sandsynligheden spredt over tusindvis af tokens), kan top-k afskære relevante muligheder.
  3. Top-p løser dette. Top-p tilpasser sig automatisk: få tokens når modellen er sikker, mange når den er usikker. Derfor foretrækkes top-p generelt.
  4. Kombination. Mange systemer bruger top-k og top-p sammen: top-k filtrerer først de K bedste, derefter filtrerer top-p yderligere baseret på kumulativ sandsynlighed.

Top-k i praksis

  1. Google’s API. Gemini-modellerne understøtter top-k som en eksplicit parameter. Standard er typisk K=40.
  2. Lokale modeller. Ollama, llama.cpp og andre lokale inference-engines bruger top-k som standard samplingsparameter.
  3. Kreativ skrivning. Højere K (100+) for mere varierede formuleringer.
  4. Kode og fakta. Lavere K (1-10) for præcist, forudsigeligt output.

Samplingsstrategier kan kombineres I praksis bruges temperature, top-k og top-p ofte sammen i en pipeline: først filtrerer top-k de K bedste tokens, derefter filtrerer top-p yderligere baseret på kumulativ sandsynlighed, og til sidst justerer temperature fordelingen over de resterende tokens. Rækkefølgen og kombinationen kan finjusteres til den specifikke opgave.


FAQ

Hvad er top-k sampling?

Top-k sampling er en metode der begrænser en AI-models tokenvalgmuligheder til de K mest sandsynlige tokens. Med K=50 overvejer modellen kun de 50 bedste tokens og ignorerer resten. Det er en simpel måde at styre balancen mellem fokus og kreativitet i AI-output.

Hvad er forskellen på top-k og top-p?

Top-k tager altid et fast antal tokens (K styk). Top-p tager et varierende antal tokens baseret på kumulativ sandsynlighed. Top-p tilpasser sig automatisk til konteksten og foretrækkes generelt, men de kan bruges sammen.

Hvad bør K sættes til?

For præcise, faktuelt korrekte svar: K=1-10. For generelle opgaver: K=40-50 (standard i mange API'er). For kreativ skrivning: K=100+. Eksperimentér med din use case.


Relaterede termer