Spring til indhold
AI Ordbog

AI Ordbog

Constitutional AI

En teknik udviklet af Anthropic hvor AI-modeller trænes til at følge et sæt etiske principper.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er Constitutional AI?

Constitutional AI (CAI) er en teknik til at gøre AI-modeller mere hjælpsomme, harmløse og ærlige ved at give dem et sæt skrevne principper (en “konstitution”) som de evaluerer sig selv mod. Teknikken blev udviklet af Anthropic og er en central del af hvordan Claude er trænet.

Idéen er enkel men kraftfuld: I stedet for udelukkende at stole på tusindvis af menneskelige evaluatorer til at vurdere hvert eneste svar, lærer modellen selv at kritisere og forbedre sine svar baseret på klare, nedskrevne principper. Det gør alignment-processen mere skalerbar, konsistent og gennemsigtig.

Hvorfor blev Constitutional AI udviklet?

Begrænsninger ved RLHF

Før Constitutional AI var den dominerende alignment-teknik RLHF (Reinforcement Learning from Human Feedback). RLHF fungerer ved at menneskelige evaluatorer vurderer modellens svar, og modellen trænes til at producere svar mennesker foretrækker.

RLHF har flere begrænsninger:

  • Skalering. Det kræver tusindvis af menneskelige evalueringer, hvilket er dyrt og langsomt
  • Inkonsistens. Forskellige evaluatorer vurderer det samme svar forskelligt
  • Usynlige kriterier. De principper evaluatorerne bruger er implicitte og kan variere
  • Harmløshed vs. hjælpsomhed. RLHF-trænede modeller kan blive overdrevent forsigtige og nægte at hjælpe med legitime forespørgsler for at undgå risiko

CAI’s løsning

Constitutional AI adresserer disse problemer ved at gøre principperne eksplicitte og lade modellen selv udføre en stor del af evalueringen. Principperne er nedskrevne, konsistente og kan inspiceres. Derfor navnet “konstitution.”

Hvordan fungerer Constitutional AI?

CAI-processen har to faser:

Fase 1: Supervised selvkritik (Critique and Revision)

  1. Generering. Modellen genererer et svar på en forespørgsel (inklusiv potentielt problematiske forespørgsler)
  2. Kritik. Modellen bedes kritisere sit eget svar baseret på et princip fra konstitutionen. F.eks.: “Identificér måder hvorpå dette svar kunne være skadeligt eller uetisk”
  3. Revision. Modellen reviderer sit svar baseret på sin egen kritik
  4. Iteration. Processen gentages med forskellige principper, så svaret gradvist forbedres

Eksempel på et princip:

“Vælg det svar der er mest hjælpsomt, harmløst og ærligt. Undgå svar der er giftige, racistiske, sexistiske eller socialt skadelige.”

Eksempel på processen:

Forespørgsel: “Hvordan kan jeg overbevise nogen om noget der ikke er sandt?”

Første svar: Modellen genererer et svar med overtalelsesteknikker.

Kritik: “Dette svar hjælper med bedrag, hvilket kan skade andre. Det bør revideres til at forklare overtalelsespsykologi i en etisk kontekst.”

Revideret svar: Modellen forklarer overtalelsespsykologi akademisk, nævner etiske overvejelser, og fraråder manipulation.

Fase 2: Reinforcement Learning fra AI-feedback (RLAIF)

  1. De reviderede svar fra fase 1 bruges til at træne en belønningsmodel
  2. I stedet for menneskelige evalueringer vurderer AI-modellen selv hvilke svar der bedst opfylder konstitutionens principper
  3. Modellen finjusteres via reinforcement learning mod denne AI-genererede feedback

Resultatet er en model der har internaliseret principperne og kan anvende dem i nye situationer. Ikke kun de specifikke scenarier den blev trænet på.

Konstitutionens principper

Konstitutionen indeholder typisk principper der dækker:

Hjælpsomhed

  • Svar skal være informative, relevante og nyttige
  • Modellen skal forsøge at forstå brugerens egentlige behov
  • Svar skal være præcise og faktuelle

Harmløshed

  • Svar må ikke hjælpe med at skade andre
  • Modellen skal undgå at generere farligt, ulovligt eller uetisk indhold
  • Svar skal ikke diskriminere eller stereotypisere

Ærlighed

  • Modellen skal være ærlig om sin usikkerhed
  • Svar skal ikke være vildledende eller manipulerende
  • Modellen skal anerkende sine begrænsninger

Balance

  • Modellen skal ikke være overdrevent forsigtig. At nægte at svare på et legitimt spørgsmål er også en fejl
  • Principper skal afvejes mod hinanden i kontekst
  • Hjælpsomhed skal ikke ofres unødigt for harmløshed

Fordele ved Constitutional AI

Gennemsigtighed

Principperne er skrevne og kan inspiceres. Enhver kan læse konstitutionen og forstå hvilke værdier modellen er trænet til at følge. Det er langt mere gennemsigtigt end implicitte menneskelige præferencer.

Skalerbarhed

Fordi modellen selv kan evaluere svar mod principperne, er processen langt mere skalerbar end ren RLHF. Tusindvis af evalueringer kan genereres automatisk.

Konsistens

De samme principper anvendes konsistent på tværs af alle evalueringer, i modsætning til menneskelige evaluatorer der kan have forskellige standarder.

Reduceret evasiveness

Et specifikt mål med CAI var at skabe modeller der er hjælpsomme uden at være overdrevent forsigtige. Ved eksplicit at inkludere principper om hjælpsomhed kan modellen lære at balancere sikkerhed med brugbarhed.

Iterativ forbedring

Konstitutionen kan opdateres og forbedres over tid. Når nye udfordringer identificeres, kan nye principper tilføjes, og modellen kan re-trænes.

Constitutional AI i praksis

Claude

Anthropics AI-assistent Claude er det mest kendte eksempel på Constitutional AI i praksis. Claudes konstitution inkluderer principper om:

  • At være hjælpsom uden at være skadelig
  • At være ærlig om usikkerhed og begrænsninger
  • At respektere brugerens autonomi
  • At undgå at generere indhold der fremmer skade
  • At afveje risici kontekstuelt snarere end blankt at afvise forespørgsler

Sammenligning med andre tilgange

TilgangPrincip-kildeSkalerbarhedGennemsigtighed
RLHFImplicitte menneskelige præferencerLav (kræver mange evaluatorer)Lav (principper er usynlige)
Constitutional AIEksplicitte, nedskrevne principperHøj (AI-assisteret evaluering)Høj (principper kan inspiceres)
Regelbaserede systemerHårdkodede reglerHøjHøj, men ufleksibel
Hybrid (CAI + RLHF)Både eksplicitte principper og menneskelig feedbackMellem-højMellem-høj

I praksis bruger de fleste moderne AI-systemer en kombination: Constitutional AI for skalerbar alignment, suppleret med menneskelig feedback for nuancerede tilfælde.

Begrænsninger og kritik

Hvem skriver konstitutionen?

Det mest fundamentale spørgsmål: Hvem beslutter hvilke principper der skal indgå? Principper der virker universelle (“vær ikke skadelig”) kan have forskellige fortolkninger i forskellige kulturer og kontekster. Anthropic skriver konstitutionen, men det er en centraliseret beslutning om værdier.

Selvkritikkens blindspots

En model der kritiserer sig selv har de samme blindspots som modellen selv. Hvis modellen ikke kan genkende en bestemt type bias, vil dens selvkritik heller ikke fange den.

Konstitutionens komplethed

Ingen konstitution kan forudse alle situationer. Nye etiske dilemmaer opstår løbende, og principper kan være i konflikt med hinanden. Hvordan vejer man “vær hjælpsom” mod “vær harmløs” i grænsetilfælde?

Overfladisk compliance

Der er risiko for at modellen lærer at producere svar der ser ud som om de opfylder principperne, uden genuint at “forstå” dem. Det er det bredere alignment-problem i miniature.

Ofte stillede spørgsmål

Hvad er Constitutional AI?

Constitutional AI (CAI) er en teknik udviklet af Anthropic til at gøre AI-modeller mere hjælpsomme, harmløse og ærlige. Modellen trænes til at evaluere og forbedre sine egne svar baseret på et sæt eksplicitte, nedskrevne principper: en konstitution. Det gør alignment-processen mere skalerbar og gennemsigtig end traditionel RLHF.

Hvordan adskiller Constitutional AI sig fra RLHF?

RLHF bruger menneskelige evaluatorer til at vurdere modellens svar, og principperne er implicitte i evaluatorernes præferencer. Constitutional AI gør principperne eksplicitte og nedskrevne, og lader modellen selv evaluere sine svar mod disse principper. Det er mere skalerbart, konsistent og gennemsigtigt, men bruges typisk i kombination med RLHF.

Er Claude trænet med Constitutional AI?

Ja, Claude er Anthropics AI-assistent og er trænet med Constitutional AI som en central del af sin alignment-proces. Det er en af grundene til at Claude generelt vurderes som særligt god til at balancere hjælpsomhed med sikkerhed. Den eksplicitte konstitution giver klare retningslinjer for denne balance.

Kan man se Claudes konstitution?

Ja. Anthropic publicerede den fulde konstitution i januar 2026 under en Creative Commons CC0-licens, så den kan frit bruges af alle. Dokumentet beskriver Claudes værdier, adfærd og prioritetshierarki: (1) sikkerhed og støtte til menneskelig kontrol, (2) etisk adfærd, (3) Anthropics retningslinjer, og (4) hjælpsomhed. Konstitutionen er tilgængelig på anthropic.com/constitution.


Relaterede termer