AI Ordbog
RLHF (Reinforcement Learning from Human Feedback)
Teknikken der gør sprogmodeller hjælpsomme og sikre via menneskelig feedback.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er RLHF?
RLHF (Reinforcement Learning from Human Feedback) er den teknik der transformerede sprogmodeller fra imponerende tekstgeneratorer til nyttige AI-assistenter. Det er processen der gør, at ChatGPT svarer hjælpsomt på dine spørgsmål i stedet for at producere tilfældig (men grammatisk korrekt) tekst.
En præ-trænet sprogmodel kan generere tekst, men den er ikke nødvendigvis hjælpsom, ærlig eller sikker. Den kan give skadelige råd, opfinde fakta eller ignorere din instruktion. RLHF løser dette ved at bruge menneskelig feedback som belønningssignal: mennesker vurderer modellens output, og modellen lærer at producere svar som mennesker foretrækker.
RLHF blev populariseret af OpenAI’s InstructGPT-paper i 2022 og var den afgørende ingrediens der gjorde ChatGPT til en sensation. Uden RLHF ville GPT-3.5 bare have været endnu en sprogmodel der forudsiger næste token. Med RLHF blev den en assistent milliarder af mennesker bruger dagligt.
Hvordan fungerer RLHF?
RLHF-processen har tre trin:
- Supervised Fine-Tuning (SFT). Først finjusteres den præ-trænede model på eksempler af gode svar, typisk skrevet af mennesker. Hvis en bruger spørger “Hvad er fotosyntese?”, skrives et godt, hjælpsomt svar som modellen trænes til at efterligne. Dette giver modellen en grundlæggende forståelse af hvad et godt svar er.
- Reward Model-træning. Mennesker præsenteres for flere mulige svar til det samme spørgsmål og rangerer dem fra bedst til dårligst. Disse rangeringer bruges til at træne en reward model. Et separat neuralt netværk der lærer at score svar baseret på menneskers præferencer. Reward modellen lærer hvad mennesker foretrækker uden at kræve eksplicitte regler.
- RL-optimering. Den finjusterede sprogmodel optimeres med reinforcement learning (typisk PPO-algoritmen) for at maksimere scoren fra reward modellen. Modellen genererer svar, reward modellen scorer dem, og modellen justeres for at producere svar der scorer højere. Denne proces gentages tusindvis af gange.
Hvad vurderer mennesker?
Menneskelige annotatorer vurderer svar på flere dimensioner:
- Hjælpsomhed. Besvarer svaret faktisk brugerens spørgsmål? Er det brugbart og relevant?
- Ærlighed. Er svaret faktuelt korrekt? Indrømmer modellen når den er usikker i stedet for at opfinde svar?
- Sikkerhed. Afviser modellen at hjælpe med skadelige opgaver? Er svaret frit for bias og diskrimination?
- Kvalitet. Er svaret velskrevet, velstruktureret og passende detaljeret?
- Instruktionsfølgning. Gør modellen hvad brugeren beder om, i det format brugeren foretrækker?
Hvorfor var RLHF et gennembrud?
RLHF løste et fundamentalt problem: hvordan formidler man menneskelige præferencer til en AI-model?
- Præferencer er svære at formulere. Vi kan ikke skrive et sæt regler der dækker alle aspekter af “et godt svar”. Men vi kan intuitivt vurdere om ét svar er bedre end et andet. RLHF udnytter denne menneskelige intuition.
- Alignment. RLHF er en nøgleteknologi inden for AI alignment. Arbejdet med at sikre at AI-systemer handler i overensstemmelse med menneskelige værdier og intentioner.
- Skalerbarhed. Selvom menneskelig feedback er dyr, kræver RLHF langt mindre data end supervised fine-tuning fordi reward modellen kan generalisere fra relativt få eksempler.
Fra ren tekst-forudsiger til assistent En præ-trænet GPT-model der bliver bedt om at “skrive et haiku om kaffe” kan svare med “skriv et digt om te” eller “haiku er en japansk digtform”. Den forudsiger hvad der sandsynligvis følger efter din tekst, men forstår ikke at du beder om noget. RLHF lærer modellen at opfatte prompts som instruktioner og svare med det brugeren faktisk vil have.
RLHF i praksis
- ChatGPT og GPT-4. OpenAI bruger RLHF til at finjustere alle sine GPT-modeller. Det er primært RLHF der gør ChatGPT hjælpsom og sikker.
- Claude. Anthropic bruger en kombination af RLHF og Constitutional AI (RLAIF) til at træne Claude. Claude er designet med særligt fokus på sikkerhed og ærlighed.
- Gemini. Google bruger RLHF og relaterede teknikker til at finjustere Gemini-modellerne.
- Open source-modeller. Llama og Mistral bruger også RLHF i deres finjusterede varianter (f.eks. Llama Chat).
Begrænsninger og kritik
- Subjektivitet. Hvad mennesker foretrækker er subjektivt. Forskellige annotatorer kan have forskellige præferencer, og den resulterende model afspejler majoritetsopfattelsen.
- Overoptimering. Modellen kan lære at “hacke” reward modellen: producere svar der scorer højt men ikke nødvendigvis er bedre. F.eks. længere svar der lyder autoritative men ikke er mere korrekte.
- Omkostninger. Menneskelig annotation er dyrt. Det kræver tusindvis af timer med kvalificerede annotatorer.
- Sycophancy. RLHF kan gøre modeller overdrevent enige og behagelige. De siger hvad brugeren vil høre i stedet for hvad der er korrekt.
- Reduceret kreativitet. RLHF kan gøre modeller mere konservative og ensartede i deres svar, fordi “sikre” svar typisk scores højere.
FAQ
Hvad er RLHF?
RLHF (Reinforcement Learning from Human Feedback) er en teknik der bruger menneskelig feedback til at finjustere sprogmodeller via reinforcement learning. Mennesker vurderer modellens svar, og modellen lærer at producere output som mennesker foretrækker. Det er teknikken der gør ChatGPT og Claude hjælpsomme og sikre.
Hvorfor er RLHF nødvendigt?
En præ-trænet sprogmodel kan generere tekst, men den er ikke nødvendigvis hjælpsom, ærlig eller sikker. RLHF justerer modellen så den forstår brugerens intention og svarer på en måde mennesker finder nyttig, i stedet for bare at producere sandsynlig tekst.
Hvad er forskellen på RLHF og RLAIF?
RLHF bruger menneskelig feedback til at træne reward modellen. RLAIF (Reinforcement Learning from AI Feedback) bruger en anden AI-model til at give feedback i stedet for mennesker. Anthropic's Constitutional AI er en form for RLAIF. Fordelen ved RLAIF er at det er billigere og mere skalerbart, men kvaliteten afhænger af den AI der giver feedback.
Er RLHF det eneste der gør sprogmodeller gode?
Nej, men det er en afgørende komponent. Kvaliteten af den præ-trænede model, størrelsen, træningsdataene og supervised fine-tuning er alle vigtige. RLHF er det sidste trin der polerer modellen og gør den til en nyttig assistent i stedet for bare en tekstgenerator.