AI Ordbog
AI safety
Forskningsfeltet der arbejder på at gøre AI-systemer sikre, pålidelige og robuste.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er AI safety?
AI safety (AI-sikkerhed) er det brede forsknings- og praksisfelt der handler om at sikre, at AI-systemer er sikre, pålidelige, robuste og gavnlige for mennesker. Det dækker hele spektret fra tekniske sikkerhedsforanstaltninger i daglige AI-produkter til dybere spørgsmål om langsigtede risici ved avanceret AI.
AI safety er paraplyen der samler mange underdiscipliner: AI alignment (sikre at AI handler efter menneskelige værdier), robusthed (sikre at AI fungerer pålideligt), sikkerhed mod misbrug (forhindre at AI bruges til skade) og governance (politikker og regler for ansvarlig AI-udvikling).
Hvorfor er AI safety vigtigt?
AI-systemer bruges i stigende grad til beslutninger med reelle konsekvenser: medicinsk diagnostik, kreditvurdering, autonome køretøjer, infrastruktur og national sikkerhed. Fejl i disse systemer kan koste liv, penge og tillid.
Samtidig stiger AI-systemers kapabilitet hurtigt. Modeller der for to år siden ikke kunne bestå en advokateksamen, kan nu præstere i top 10%. Denne acceleration gør det afgørende at sikkerhedsforskning holder trit med kapabilitetsudviklingen.
Risici på kort sigt
- Fejlagtige beslutninger. AI der stiller forkerte diagnoser, giver dårlig finansiel rådgivning eller diskriminerer i ansættelser
- Misbrug. AI brugt til desinformation, svindel, overvågning eller cyberangreb
- Upålidelighed. AI der virker under test men fejler i virkelige situationer
- Tab af menneskelig kontrol. Automatiserede systemer der træffer beslutninger uden tilstrækkelig menneskelig oversigt
Risici på lang sigt
- Meget kapable systemer der er svære at kontrollere og overvåge
- Magtkoncentration hos de få aktører der kontrollerer de mest avancerede AI-systemer
- Autonome systemer der handler uforudsigeligt i nye situationer
- Systemiske risici ved bred afhængighed af AI i kritisk infrastruktur
Kerneområder inden for AI safety
Robusthed
Et sikkert AI-system skal fungere pålideligt, ikke kun under ideelle forhold, men også i uventede situationer:
- Distributionsskift. Modellen møder data der afviger fra træningsdata (f.eks. en selvkørende bil der møder vejrforhold den ikke er trænet på)
- Adversarial attacks. Bevidste forsøg på at narre AI-systemet (f.eks. at ændre et stoptskilt så en computer vision-model misklassificerer det)
- Edge cases. Sjældne situationer der ikke er godt repræsenteret i træningsdata
Alignment
Sikring af at AI-systemer forfølger de mål mennesker intenderer, ikke blot de mål der formelt er specificeret. Se den dedikerede artikel om AI alignment for en dybere gennemgang.
Fortolkelighed og gennemsigtighed
Evnen til at forstå hvorfor en AI-model træffer bestemte beslutninger. Det er kritisk for:
- Tillid. Brugere og beslutningstagere skal kunne forstå AI-systemets ræsonnement
- Fejlfinding. Udviklere skal kunne identificere og rette fejl
- Ansvarlighed. Hvis et AI-system træffer en forkert beslutning, skal det være muligt at forstå hvorfor
- Regulering. EU AI Act kræver forklarbarhed for højrisiko AI-systemer
Sikkerhed mod misbrug
Forhindring af at AI-systemer bruges til skadelige formål:
- Desinformation. Generering af overbevisende falsk tekst, billeder og video
- Cyberangreb. AI der hjælper med at finde og udnytte sikkerhedshuller
- Masseovervågning. Ansigtsgenkendelse og adfærdsanalyse i stor skala
- Biologiske og kemiske våben. AI der assisterer med farlig videnskabelig forskning
Menneskelig kontrol
Sikring af at mennesker bevarer meningsfuld kontrol over AI-systemer:
- Kill switches. Mulighed for at stoppe et AI-system øjeblikkeligt
- Human-in-the-loop. Mennesker involveret i kritiske beslutninger
- Oversight-mekanismer. Løbende overvågning af AI-systemers adfærd
- Korrigerbarhed. Mulighed for at rette AI-systemets kurs hvis det afviger
AI safety i praksis
Hvordan AI-virksomheder arbejder med safety
De store AI-virksomheder har dedikerede safety-teams og -processer:
Anthropic har AI safety som sin kernemission. De har udviklet Constitutional AI, investerer markant i interpretability-forskning og publicerer safety-rapporter for nye modeller.
OpenAI har et safety-team der arbejder med red teaming, alignment-forskning og en “Preparedness Framework” for at evaluere risici ved nye modeller.
Google DeepMind forsker i alignment, robusthed og har publiceret en række safety-retningslinjer for AI-udvikling.
Red teaming
En central safety-praksis: dedikerede teams forsøger systematisk at finde svagheder og farlig adfærd i AI-systemer før de lanceres. Red teaming kan afsløre:
- Måder at omgå sikkerhedsforanstaltninger (jailbreaking)
- Situationer hvor modellen giver farlige råd
- Bias og diskrimination i modellens output
- Uventede kapabiliteter der kan misbruges
Safety evaluations
Før lancering gennemgår moderne AI-modeller omfattende sikkerhedsevalueringer:
- Automatiserede test-suites med tusindvis af test-cases
- Menneskelig evaluering af modellens adfærd i sensitive scenarier
- Ekstern sikkerhedsaudit af uafhængige forskere
- Stresstesting med edge cases og adversarial inputs
Guardrails og tekniske sikkerhedsforanstaltninger
Praktiske mekanismer der begrænser hvad AI-systemer kan gøre:
- Input-filtrering. Blokering af skadelige forespørgsler
- Output-filtrering. Scanning af AI-genereret indhold for skadeligt materiale
- Rate limiting. Begrænsning af hvor hurtigt systemet kan bruges (forhindrer automatiseret misbrug)
- Scope-begrænsning. AI-systemer der kun har adgang til de ressourcer de har brug for
Governance og regulering
EU AI Act
Verdens første omfattende AI-lovgivning, vedtaget i 2024. Klassificerer AI-systemer efter risikoniveau:
- Uacceptabel risiko. Forbudt (f.eks. social scoring, visse former for masseovervågning)
- Høj risiko. Strenge krav til sikkerhed, gennemsigtighed og menneskelig oversight (f.eks. AI i sundhed, ansættelse, kreditvurdering)
- Begrænset risiko. Gennemsigtighedskrav (f.eks. chatbots skal oplyse at de er AI)
- Minimal risiko. Ingen specifikke krav (f.eks. AI i spil, spamfiltre)
AI Safety Institutes
Flere lande har oprettet dedikerede AI-sikkerhedsinstitutter:
- UK AI Security Institute (tidligere AI Safety Institute). Verdens første statslige AI-sikkerhedsinstitut, omdøbt i 2025 med øget fokus på sikkerhedsrisici
- US Center for AI Standards and Innovation (CAISI) (tidligere AI Safety Institute). Under NIST, omdøbt i 2025 med fokus på standarder og national sikkerhed
- EU AI Office. Håndhæver EU AI Act
Internationale aftaler
AI-sikkerhed er et voksende tema i international politik. Bletchley-deklarationen (2023) var den første internationale aftale om AI-sikkerhed, underskrevet af 28 lande inklusiv USA, Kina og EU.
Praktiske eksempler
Eksempel 1: Safety i en medicinsk AI
En AI der analyserer røntgenbilleder for kræft implementerer flere safety-lag:
- Kalibreret usikkerhed. Modellen angiver sin konfidensscore og flagger tilfælde med lav sikkerhed
- Human-in-the-loop. En læge gennemgår altid modellens vurdering før diagnose
- Distributionsdetektion. Systemet genkender billeder der afviger fra træningsdata og afviser dem
- Audit trail. Alle beslutninger logges for efterfølgende gennemgang
Eksempel 2: Safety i en AI-chatbot
En kundeservice-chatbot har disse sikkerhedsforanstaltninger:
- Afviser forespørgsler om skadeligt indhold
- Eskalerer til et menneske ved sensitive emner
- Angiver klart at den er en AI
- Logger alle samtaler for kvalitetssikring
- Har begrænsede handlemuligheder (kan ikke ændre kontoindstillinger uden menneskelig godkendelse)
Eksempel 3: Safety ved AI-kodning
En AI-kodningsassistent implementerer safety via:
- Scanning af genereret kode for kendte sikkerhedssårbarheder
- Advarsler ved potentielt farlige operationer (sletning af data, ændring af rettigheder)
- Begrænsning af adgang til filsystem og netværk
- Krav om menneskelig godkendelse før udførelse af irreversible handlinger
Ofte stillede spørgsmål
Hvad er AI safety?
AI safety er forsknings- og praksisfeltet der arbejder på at gøre kunstig intelligens sikker, pålidelig, robust og gavnlig. Det dækker teknisk sikkerhed (robusthed, alignment, fortolkelighed), forebyggelse af misbrug, menneskelig kontrol og governance/regulering af AI-systemer.
Hvad er forskellen på AI safety og AI alignment?
AI safety er det brede felt der dækker alle aspekter af AI-sikkerhed. AI alignment er en underdisciplin af AI safety der specifikt fokuserer på at sikre, at AI-systemers mål og adfærd er i overensstemmelse med menneskelige værdier og intentioner. Safety dækker også robusthed, misbrug, governance og regulering.
Hvorfor investerer AI-virksomheder i safety?
Dels af etiske grunde: AI der forårsager skade er uacceptabelt. Dels af forretningsmæssige grunde: brugere og virksomheder vil have AI-systemer de kan stole på, og regulering som EU AI Act stiller krav til sikkerhed. Og dels fordi safety-forskning er nødvendig for at bygge mere kapable systemer ansvarligt.
Hvad er EU AI Act, og hvad betyder den for AI safety?
EU AI Act er verdens første omfattende AI-lovgivning, vedtaget i 2024. Den klassificerer AI-systemer efter risikoniveau og stiller krav til sikkerhed, gennemsigtighed og menneskelig oversight for højrisiko-systemer. Den forbyder visse AI-anvendelser helt og kræver at AI-udbydere dokumenterer deres sikkerhedsforanstaltninger.