Spring til indhold
AI Ordbog

AI Ordbog

Reinforcement Learning (RL)

Maskinlæring hvor en agent lærer ved at prøve handlinger og modtage belønning.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er Reinforcement Learning?

Reinforcement Learning (forkortet RL, forstærkningslæring på dansk) er en type maskinlæring hvor en agent lærer at træffe beslutninger ved at interagere med et miljø. Agenten udfører handlinger, observerer konsekvenserne og modtager belønning eller straf. Over tid lærer den at vælge handlinger der maksimerer den samlede belønning.

Det er som at træne en hund: du belønner god adfærd med en godbid og ignorerer eller korrigerer dårlig adfærd. Hunden lærer over tid hvad der fører til godbidder. RL fungerer på præcis samme måde, bare med matematiske belønninger i stedet for hundekiks.

RL er fundamentalt anderledes end supervised learning (der lærer fra mærkede eksempler) og unsupervised learning (der finder mønstre i data). RL lærer fra interaktion. Fra at prøve ting, fejle og justere.

Det var RL der gjorde det muligt for AlphaGo at slå verdens bedste Go-spiller i 2016. Et øjeblik mange betragter som et af de største gennembrud i AI’s historie. I dag er RL også nøgleteknologien bag RLHF, den teknik der gør sprogmodeller som ChatGPT og Claude hjælpsomme og sikre.

Kernekoncepter

RL har sit eget begrebsapparat:

  1. Agent. Det system der lærer og træffer beslutninger. I et spil er agenten spilleren. I robottik er det robotten. I RLHF er det sprogmodellen.
  2. Miljø (environment). Verden agenten interagerer med. Et skakbræt, en vejbane, et samtalesystem.
  3. Tilstand (state). Miljøets aktuelle situation. Brikkernes position på skakbrættet, bilens hastighed og position, den hidtidige samtale.
  4. Handling (action). Hvad agenten kan gøre. Flytte en brik, dreje rattet, generere det næste token.
  5. Belønning (reward). Et tal der fortæller agenten hvor god en handling var. Positiv belønning for gode handlinger, negativ for dårlige. I skak: +1 for at vinde, -1 for at tabe.
  6. Politik (policy). Agentens strategi: reglen der bestemmer hvilken handling den tager i en given tilstand. Målet med RL er at finde den optimale politik.

Hvordan fungerer RL?

Træningsprocessen er en løkke:

  1. Observer tilstand. Agenten ser miljøets aktuelle tilstand.
  2. Vælg handling. Baseret på sin nuværende politik vælger agenten en handling. I starten er valgene næsten tilfældige.
  3. Udfør handling. Handlingen udføres i miljøet.
  4. Modtag belønning. Miljøet giver en belønning (positiv eller negativ).
  5. Opdater politik. Agenten justerer sin politik baseret på belønningen. Handlinger der gav belønning gøres mere sandsynlige, handlinger der gav straf gøres mindre sandsynlige.
  6. Gentag. Denne løkke køres millioner eller milliarder af gange.

Vigtige RL-algoritmer

  1. Q-learning. Lærer en værdifunktion der estimerer den forventede fremtidige belønning for hver handling i hver tilstand. Simpel og effektiv for problemer med et begrænset antal tilstande.
  2. Deep Q-Network (DQN). Kombinerer Q-learning med deep learning. DeepMind brugte DQN til at spille Atari-spil på menneskeligt niveau. Et tidligt gennembrud i deep RL.
  3. Policy Gradient. I stedet for at lære en værdifunktion, optimerer policy gradient-metoder politikken direkte. Bedre til problemer med kontinuerlige handlinger (som robotstyring).
  4. PPO (Proximal Policy Optimization). Den mest brugte RL-algoritme i dag. Stabil, effektiv og relativt nem at tune. Bruges i RLHF til at finjustere sprogmodeller.
  5. AlphaZero-algoritmen. Kombinerer Monte Carlo Tree Search med deep RL. Lærte at spille skak, Go og shogi på overmenneskeligt niveau fra scratch. Uden at se menneskelige partier.

RL i praksis

  1. Spil-AI. AlphaGo (Go), AlphaZero (skak, Go, shogi), OpenAI Five (Dota 2). RL har produceret AI-systemer der slår de bedste mennesker i verdens mest komplekse spil.
  2. RLHF for sprogmodeller. Den vigtigste moderne anvendelse. Sprogmodeller finjusteres med RL, hvor menneskelige vurderinger fungerer som belønningssignal. Det er RLHF der gør ChatGPT og Claude hjælpsomme, ærlige og sikre.
  3. Robotstyring. Robotter der lærer at gå, gribe objekter og navigere i komplekse miljøer. Boston Dynamics og andre bruger RL til at træne fysiske robotter.
  4. Anbefalingssystemer. YouTube, TikTok og Netflix bruger RL-lignende teknikker til at optimere hvilke videoer der vises, baseret på brugerens engagement.
  5. Energioptimering. DeepMind brugte RL til at reducere energiforbruget i Googles datacentre med 40% ved at optimere kølesystemer.

Exploration vs. exploitation RL-agenter står over for et klassisk dilemma: skal de udnytte det de allerede ved virker (exploitation), eller prøve nye ting der måske er endnu bedre (exploration)? For meget exploitation, og agenten sidder fast i suboptimale strategier. For meget exploration, og den spilder tid på dårlige handlinger. At balancere dette er et af RL’s kerneproblemer. Og det minder om en helt grundlæggende udfordring i menneskelig beslutningstagning.

Begrænsninger

  1. Sample-inefficiens. RL kræver typisk millioner eller milliarder af interaktioner for at lære. Det er hurtigt i simulerede miljøer (spil), men langsomt og dyrt i den virkelige verden (robotter).
  2. Belønningsdesign. At definere den rigtige belønningsfunktion er overraskende svært. En dårligt designet belønning kan føre til uønsket adfærd. En robot der skal gå hurtigt kan lære at falde fremad i stedet for at gå.
  3. Stabilitet. RL-træning kan være ustabil. Agenten kan pludselig glemme hvad den har lært eller gøre uventede ting.
  4. Sim-to-real gap. Strategier lært i simulation fungerer ikke altid i den virkelige verden. Simulationer er forenklede, og den virkelige verden er fuld af uforudsete situationer.

FAQ

Hvad er Reinforcement Learning?

Reinforcement Learning (RL) er en type maskinlæring hvor en agent lærer at træffe beslutninger ved at interagere med et miljø og modtage belønning eller straf. Over tid lærer agenten en strategi (politik) der maksimerer den samlede belønning. RL er teknologien bag spil-AI som AlphaGo og finjustering af sprogmodeller via RLHF.

Hvad er forskellen på RL og supervised learning?

Supervised learning lærer fra mærkede eksempler med kendte svar. RL lærer fra interaktion med et miljø via belønning og straf, uden at kende det "rigtige" svar på forhånd. RL er bedre til sekventiel beslutningstagning, mens supervised learning er bedre til direkte input-output-mapping.

Hvad er RLHF?

RLHF (Reinforcement Learning from Human Feedback) er en teknik hvor RL bruges til at finjustere sprogmodeller baseret på menneskelig feedback. Mennesker vurderer modellens svar, og RL bruger disse vurderinger som belønningssignal til at gøre modellen mere hjælpsom, ærlig og sikker. Det er nøgleteknologien bag ChatGPT og Claude.

Hvorfor slog AlphaGo verdensmesteren i Go?

AlphaGo kombinerede deep learning med reinforcement learning. Den trænede ved at spille millioner af partier mod sig selv (self-play RL) og lærte strategier ingen mennesker havde set før. Det var et gennembrud fordi Go har flere mulige positioner end der er atomer i universet, hvilket gør brute force umuligt.


Relaterede termer