AI Ordbog
Guardrails
Sikkerhedsmekanismer der holder AI-modeller inden for acceptable grænser.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er guardrails?
Guardrails er de sikkerhedsmekanismer der holder AI-modeller inden for acceptable grænser. De forhindrer modellen i at generere skadeligt, upassende eller uønsket indhold og sikrer at den opfører sig som tilsigtet.
Navnet er en metafor fra autoværn (guardrails) langs en vej: de forhindrer biler i at køre ud over kanten. AI-guardrails forhindrer modeller i at “køre af vejen”: generere farlig kode, afsløre private data, producere diskriminerende indhold eller svare på spørgsmål den ikke bør besvare.
Guardrails er ikke én ting men et helt lag af beskyttelsesmekanismer der tilsammen gør AI-modeller sikre nok til professionel brug. Uden guardrails ville rå AI-modeller være for uforudsigelige til at sætte foran brugere.
Typer af guardrails
- Input-guardrails. Filtrerer brugerens input før det når modellen. Blokerer prompt injections, skadeligt indhold og forsøg på at manipulere modellen.
- Output-guardrails. Filtrerer modellens output før det vises til brugeren. Fjerner persondata, skadeligt indhold, kode der kan misbruges, og faktuelt forkert information.
- Emne-guardrails. Holder modellen inden for et bestemt emne. En kundesupport-bot skal svare på spørgsmål om virksomhedens produkter. Ikke give medicinsk rådgivning.
- Tone-guardrails. Sikrer at modellen opretholder en passende tone: professionel, venlig, ikke-offensiv.
- Handlings-guardrails. For AI-agenter: begrænsninger på hvilke handlinger agenten må udføre. En agent må måske læse data men ikke slette det.
Hvordan implementeres guardrails?
- System prompt. Den mest grundlæggende guardrail. Instruktioner som “Du må ikke give medicinsk rådgivning” eller “Henvis til support for spørgsmål du ikke kan besvare.”
- RLHF-træning. Modellen er trænet med menneskeligt feedback til at afvise skadelige forespørgsler. Det er derfor ChatGPT og Claude siger nej til visse spørgsmål.
- Klassifikationsmodeller. Separate AI-modeller der vurderer både input og output for skadeligt indhold før det passerer igennem.
- Regelbaserede filtre. Hårde regler som “output må ikke indeholde CPR-numre” eller “output må ikke overskride 500 ord.”
- Guardrails-frameworks. Open source-frameworks som Guardrails AI, NeMo Guardrails (NVIDIA) og Anthropics Constitutional AI der gør det nemmere at implementere robuste guardrails.
Guardrails i praksis
- ChatGPT og Claude. Alle store AI-assistenter har omfattende guardrails der forhindrer generering af skadeligt indhold, afslører persondata eller giver farlige instruktioner.
- Enterprise-chatbots. Virksomhedens AI-assistent skal holde sig til virksomhedens emner og ikke give råd om emner den ikke er kvalificeret til.
- Børnevenlige AI-produkter. Strenge guardrails for alderspassende indhold, sprog og emner.
- Kodningsassistenter. Guardrails der forhindrer generering af malware, exploits eller usikker kode.
- Sundhedspleje. AI-assistenter med guardrails der altid anbefaler at kontakte en læge for medicinske spørgsmål.
Guardrails-udfordringer
- Overfiltrering. For strenge guardrails kan gøre modellen unødigt restriktiv og frustrerende. Brugere der stiller legitime spørgsmål kan få afvisninger.
- Omgåelse. Kreative brugere finder måder at omgå guardrails via jailbreaking og prompt injection. Det er et vedvarende kat-og-mus-spil.
- Kontekst. Guardrails har svært ved at forstå kontekst. Et spørgsmål om våben kan være en historisk undersøgelse, en sikkerhedsanalyse eller noget skadeligt. Guardrails skal skelne.
- Afvejning. Mere sikkerhed = mindre nyttighed. Guardrails-design er en konstant balancegang mellem at beskytte og at være hjælpsom.
Guardrails er lagdelte Robuste AI-systemer bruger flere lag af guardrails: RLHF-træning som base-lag, system prompt som instruktionslag, input-filtre der blokerer farlige prompts, output-filtre der fanger problematisk indhold, og monitoring der tracker mønstre over tid. Ingen enkelt guardrail er tilstrækkelig alene. Det er kombinationen der skaber sikkerhed.
FAQ
Hvad er AI-guardrails?
Guardrails er sikkerhedsmekanismer der begrænser hvad en AI-model kan og må gøre. De filtrerer skadeligt indhold, holder modellen inden for emne, sikrer passende tone og forhindrer misbrug. Alle store AI-assistenter som ChatGPT og Claude har omfattende guardrails.
Hvorfor er guardrails nødvendige?
Uden guardrails kan AI-modeller generere skadeligt, forkert eller upassende indhold. Guardrails beskytter brugere, overholder lovgivning og sikrer at AI-produkter opfører sig som tilsigtet.
Kan guardrails omgås?
Ja, kreative brugere kan forsøge at omgå guardrails via jailbreaking og prompt injection. Det er derfor AI-virksomheder bruger flere lag af guardrails og konstant opdaterer dem. Det er et vedvarende kat-og-mus-spil mellem sikkerhedsforskere og dem der forsøger at omgå beskyttelsen.