Spring til indhold
AI Ordbog

AI Ordbog

Data privacy (AI)

Beskyttelse af personoplysninger i forbindelse med udvikling, træning og brug af AI-systemer.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er data privacy i AI?

Data privacy (databeskyttelse) i AI handler om at beskytte personoplysninger i alle faser af et AI-systems livscyklus, fra den data der bruges til at træne modellen, over selve modellen der potentielt kan lække information, til de output modellen producerer.

AI skaber unikke privatlivsudfordringer der går ud over traditionel databeskyttelse. En AI-model kan memorisere og reproducere personoplysninger fra sin træningsdata. Den kan udlede følsomme oplysninger fra tilsyneladende uskyldig data. Og den kan bruges til overvågning og profilering i et omfang der tidligere var umuligt.

Kernen i problemet er dette: AI-modeller bliver bedre af mere data, men mere data betyder mere risiko for privatlivet. At håndtere denne afvejning (nyttig AI med respekt for privatlivet) er en af de centrale udfordringer i moderne AI-udvikling.

Hvorfor er data privacy i AI særligt vigtigt?

AI forstærker privatlivsrisici

Traditionel software behandler data efter eksplicitte regler. AI-modeller lærer mønstre fra data og kan udlede langt mere end der eksplicit er kodet. Et AI-system kan potentielt:

  • Udlede seksuel orientering fra bevægelsesmønstre
  • Forudsige sundhedstilstande fra indkøbsdata
  • Identificere politiske holdninger fra sociale medie-mønstre
  • Genkende personer fra anonymiserede datasæt

Skala og hastighed

AI kan behandle data om millioner af mennesker på sekunder. Hvad der tidligere krævede en hær af analytikere kan nu automatiseres: overvågning, profilering og beslutningstagning i stor skala.

Uigennemsigtighed

Det er ofte svært at vide præcis hvilke data en AI-model har lært, hvad den kan udlede, og hvordan den bruger personoplysninger internt. Denne uigennemsigtighed gør det svært for individer at udøve deres rettigheder.

Vedvarende risiko

Når personoplysninger er indlejret i en AI-models parametre, kan de ikke simpelthen “slettes” som i en database. Modellen kan potentielt reproducere informationen i årevis.

Privatlivsrisici i AI’s livscyklus

Fase 1: Dataindsamling

Samtykkeproblemer Meget AI-træningsdata indsamles fra internettet: websider, sociale medier, offentlige databaser. Menneskerne bag disse data har sjældent givet eksplicit samtykke til at deres data bruges til AI-træning.

Formålsbegrænsning GDPR kræver at data kun bruges til det formål det er indsamlet til. Data indsamlet til ét formål (f.eks. en kundeundersøgelse) kan ikke frit genbruges til AI-træning.

Dataminimering GDPR kræver at kun nødvendige data indsamles. AI’s appetit på store datamængder kan stå i konflikt med dette princip.

Fase 2: Modeltræning

Memorisering Neurale netværk kan memorisere specifikke datapunkter fra deres træningsdata. Forskere har demonstreret at store sprogmodeller kan reproducere telefonnumre, e-mailadresser og andre personoplysninger fra deres træningsdata når de promptes på bestemte måder.

Indirekte læring Selv uden direkte adgang til følsomme data kan modeller lære korrelationer der afslører følsom information. En model der lærer sammenhængen mellem postnummer og kreditrisiko har indirekte lært om etnisk sammensætning.

Fase 3: Model deployment

Inferensangreb En angriber kan udlede information om træningsdata ved at analysere modellens output:

  • Membership inference. Afgøre om en bestemt person var med i træningsdata
  • Model inversion. Rekonstruere træningsdata fra modellens output
  • Attribut-inferens. Udlede følsomme attributter om personer baseret på modellens svar

Prompt-baseret ekstraktion For store sprogmodeller kan kreative prompts potentielt udtrække memoriserede personoplysninger. Forskere har demonstreret at GPT-modeller kan overtales til at reproducere specifikke personers kontaktinformation.

Fase 4: Output og brug

Profilering AI-output kan bruges til detaljeret profilering af individer (kreditscoring, sundhedsrisikovurdering, adfærdsforudsigelse) baseret på data individet aldrig har givet samtykke til.

Overvågning AI muliggør masseovervågning der tidligere var umulig: ansigtsgenkendelse, adfærdsanalyse, kommunikationsovervågning i stor skala.

GDPR og AI

Relevante GDPR-principper

PrincipImplikation for AI
Lovlighed og samtykkeDer kræves et lovligt grundlag for at bruge persondata til AI-træning
FormålsbegrænsningData indsamlet til ét formål kan ikke frit genbruges til AI-træning
DataminimeringBrug kun de data der er nødvendige for formålet
NøjagtighedAI-modeller skal producere præcise resultater om individer
OpbevaringsbegrænsningData skal slettes når formålet er opfyldt. Men hvad med data i modelparametre?
Integritet og fortrolighedTekniske sikkerhedsforanstaltninger skal beskytte data

Retten til forklaring (Artikel 22)

GDPR giver borgere ret til ikke at være underlagt beslutninger baseret udelukkende på automatiseret behandling. For AI-baserede beslutninger med væsentlig effekt (kreditvurdering, ansættelse) skal der være mulighed for menneskelig gennemgang og forklaring af beslutningsgrundlaget.

Retten til sletning (Artikel 17)

Borgere har ret til at få deres persondata slettet. “Retten til at blive glemt.” For AI er dette teknisk udfordrende: Hvordan “sletter” man en persons data fra en model der er trænet på millioner af datapunkter? Machine unlearning er et aktivt forskningsfelt der forsøger at løse dette.

Data Protection Impact Assessment (DPIA)

GDPR kræver en DPIA for behandlinger der sandsynligvis indebærer høj risiko for privatlivet. De fleste AI-systemer der behandler persondata i stor skala kræver en DPIA.

Privatlivsbeskyttende teknikker

Differential privacy

En matematisk garanti for at en individs data ikke har væsentlig indflydelse på modellens output. Fungerer ved at tilføje kontrolleret støj til data eller modellens parametre under træning.

Styrke: Stærk, kvantificerbar privatlivsgaranti. Svaghed: Tilføjelsen af støj reducerer modellens præcision. Jo stærkere privatlivsgaranti, jo mere støj, og jo lavere præcision.

Eksempel: Apple bruger differential privacy til at indsamle brugsdata fra iPhones. Hvert datapunkt tilføjes støj før det sendes, så Apple kan analysere overordnede mønstre uden at se individuelle brugeres adfærd.

Federated learning

Modellen trænes lokalt på brugernes enheder uden at rå data forlader enheden. Kun model-opdateringer (gradienter) sendes til en central server.

Styrke: Rå data forbliver på brugerens enhed. Svaghed: Gradienter kan stadig potentielt afsløre information om de underliggende data.

Eksempel: Googles Gboard-tastatur bruger federated learning til at forbedre ordforudsigelser baseret på brugernes skrivemønstre, uden at teksten forlader telefonen.

Anonymisering og pseudonymisering

Anonymisering. Irreversibel fjernelse af personidentificerbar information. Hvis data er ægte anonymiseret, er det ikke længere omfattet af GDPR. Men ægte anonymisering er svært at opnå. En undersøgelse fra Nature Communications (2019) viser at 99,98% af amerikanske borgere kan re-identificeres fra anonymiserede datasæt med bare 15 attributter.

Pseudonymisering. Personidentifikatorer erstattes med pseudonymer, men en nøgle eksisterer til re-identifikation. Pseudonymiserede data er stadig persondata under GDPR, men betragtes som en sikkerhedsforanstaltning.

Syntetisk data

Kunstigt genererede data der statistisk ligner ægte data men ikke stammer fra virkelige individer. Syntetisk data er per design ikke persondata, men kvaliteten afhænger af de ægte data det er baseret på, og der er risiko for memorisering.

Homomorphic encryption

Data krypteres, og beregninger udføres direkte på de krypterede data. Modellen kan trænes eller køre inferens uden nogensinde at se ukrypteret data.

Styrke: Stærkeste mulige privatlivsbeskyttelse. Svaghed: Ekstremt beregningstungt. Typisk 10.000-100.000 gange langsommere end ukrypterede beregninger. Praktisk anvendelighed er stadig begrænset.

Secure multi-party computation

Flere parter kan samarbejde om beregninger uden at nogen part ser de andres data. Relevant for situationer hvor flere organisationer vil træne en fælles model uden at dele rå data.

Praktiske eksempler

Eksempel 1: Hospital med AI-diagnostik

Et hospital vil dele patientdata med en AI-virksomhed til udvikling af diagnostisk AI:

  1. DPIA. Gennemfører en Data Protection Impact Assessment der identificerer risici
  2. Pseudonymisering. Fjerner navne, CPR-numre og direkte identifikatorer
  3. Differential privacy. Tilføjer støj under modeltræning for at forhindre memorisering
  4. Federated learning. Alternativt: modellen trænes lokalt på hospitalets servere, kun model-opdateringer deles
  5. Databehandleraftale. Juridisk aftale der specificerer formål, sikkerhedsforanstaltninger og rettigheder
  6. Validering. Tester at modellen ikke kan reproducere individuelle patienters data

Eksempel 2: Virksomhed der bruger LLM’er

En dansk virksomhed implementerer ChatGPT eller Claude til intern brug:

  1. Dataklassificering. Kategoriserer data i niveauer: offentlig, intern, fortrolig, strengt fortrolig
  2. Politikker. Klare regler: ingen persondata, kundedata eller fortrolig information i AI-prompts
  3. Enterprise-aftaler. Bruger enterprise-versioner med garantier om at data ikke bruges til træning
  4. Uddannelse. Træner medarbejdere i hvad der må og ikke må deles med AI-tjenester
  5. Audit-log. Overvåger brugen for at opdage utilsigtede datatab
  6. DPA. Indgår databehandleraftale med AI-leverandøren

Eksempel 3: AI-baseret markedsføring

En e-handelsvirksomhed bruger AI til personaliseret markedsføring:

  1. Samtykke. Indhenter eksplicit samtykke til AI-baseret personalisering via cookie-banner og privatlivspolitik
  2. Dataminimering. Bruger kun nødvendige data (købshistorik, browsing). Ikke lokationsdata eller sociale medier
  3. Ret til indsigelse. Kunder kan fravælge AI-baseret personalisering
  4. Opbevaringsbegrænsning. Adfærdsdata slettes efter 12 måneder
  5. Gennemsigtighed. Privatlivspolitikken forklarer tydeligt hvordan AI bruges til personalisering

Udfordringer

Afvejning mellem nytte og privatliv

Mere data giver bedre AI, men mere data betyder mere privatlivsrisiko. Privatlivsbeskyttende teknikker (differential privacy, federated learning) reducerer risikoen men kan også reducere modellens kvalitet. Den rette balance afhænger af konteksten.

Machine unlearning

Retten til sletning er teknisk udfordrende for AI. At “glemme” en persons data fra en trænet model kræver enten genoptræning (dyrt) eller approksimative unlearning-teknikker (usikkert). Feltet er stadig tidligt.

Globale forskelle

GDPR er verdens strengeste databeskyttelseslov, men mange AI-modeller trænes på data fra jurisdiktioner med svagere beskyttelse. En model trænet på globale data og deployeret i EU skaber juridiske gråzoner.

Tredjepartsmodeller

Når virksomheder bruger tredjeparts AI-modeller (som GPT eller Claude), har de begrænset kontrol over hvordan data behandles internt i modellen. Enterprise-aftaler og databehandleraftaler er vigtige, men giver ikke fuld kontrol.

Ofte stillede spørgsmål

Hvad er data privacy i AI?

Data privacy i AI handler om at beskytte personoplysninger i alle faser af et AI-systems livscyklus, fra dataindsamling og modeltræning til deployment og brug. Det omfatter risici som memorisering af træningsdata, inferensangreb og uautoriseret profilering, samt teknikker som differential privacy, federated learning og anonymisering der reducerer disse risici.

Må man bruge persondata til at træne AI under GDPR?

Ja, men kun med et lovligt grundlag. Det kan være samtykke, legitim interesse, opfyldelse af kontrakt eller andre GDPR-grundlag. Derudover skal principperne om formålsbegrænsning, dataminimering og gennemsigtighed overholdes. En DPIA er typisk påkrævet. Og den registrerede har rettigheder herunder ret til indsigt, sletning og indsigelse mod automatiserede beslutninger.

Kan en AI-model lække persondata?

Ja. Forskning har vist at store sprogmodeller kan memorisere og reproducere personoplysninger fra deres træningsdata. Herunder navne, e-mailadresser og telefonnumre. Inferensangreb kan afsløre om en person var med i træningsdata. Privatlivsbeskyttende teknikker som differential privacy reducerer risikoen, men eliminerer den ikke fuldstændigt.

Hvad er differential privacy?

Differential privacy er en matematisk teknik der sikrer at en AI-models output ikke afslører om en bestemt person var med i træningsdata. Det fungerer ved at tilføje kontrolleret støj til data eller modellens parametre under træning. Jo mere støj, jo stærkere privatlivsgaranti. Men også jo lavere præcision. Apple og Google bruger differential privacy i flere af deres produkter.


Relaterede termer