AI Ordbog
Syntetisk data
Kunstigt genererede data der statistisk ligner ægte data, men ikke stammer fra virkelige observationer.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er syntetisk data?
Syntetisk data er data der er kunstigt genereret (typisk af en algoritme eller AI-model) i stedet for at være indsamlet fra den virkelige verden. Dataene er designet til at have de samme statistiske egenskaber, mønstre og strukturer som ægte data, men indeholder ingen faktiske observationer af virkelige personer, hændelser eller transaktioner.
Forestil dig at du har brug for 100.000 patientjournaler til at træne en medicinsk AI, men kun har adgang til 5.000 på grund af privatlivshensyn. Syntetisk data kan generere de resterende 95.000 journaler med realistiske fordelinger af diagnoser, aldre, symptomer og behandlingsresultater, uden at nogen virkelig patients data er involveret.
Gartner forudsagde at 60% af al data brugt til AI-udvikling ville være syntetisk inden 2024. Tendensen er klar: syntetisk data er gået fra niche-teknik til mainstream praksis.
Hvorfor bruge syntetisk data?
Privatliv og databeskyttelse
Den mest oplagte grund: syntetisk data indeholder ingen personoplysninger. Under GDPR og andre databeskyttelseslove er brugen af persondata til AI-træning underlagt strenge regler om samtykke, formålsbegrænsning og dataminimering. Syntetisk data omgår disse begrænsninger, fordi dataene ikke relaterer sig til virkelige personer.
Det er særligt relevant i sektorer med følsomme data: sundhed, finans, forsikring og offentlig forvaltning.
Dataknaphed
I mange domæner er der simpelthen ikke nok ægte data til at træne effektive AI-modeller:
- Sjældne sygdomme: Der er måske kun hundredvis af dokumenterede tilfælde
- Nye produkter: Ingen historiske data at træne på
- Sjældne hændelser: Svindel, cyberangreb eller systemfejl der per definition er sjældne
- Nye markeder: Begrænset data fra nye geografier eller demografier
Bias-korrektion
Ægte data afspejler historiske skævheder. Syntetisk data kan genereres med balancerede fordelinger der korrigerer for underrepræsentation:
- Generere flere datapunkter for underrepræsenterede grupper
- Balancere klasser i skæve datasæt (f.eks. 99% ikke-svindel vs. 1% svindel)
- Fjerne uønskede korrelationer mellem beskyttede karakteristika og udfaldsvariabler
Hastighed og cost
Indsamling og annotering af ægte data er dyrt og langsomt. Syntetisk data kan genereres hurtigt og billigt i store mængder. Det er særligt værdifuldt i hurtige udviklingscyklusser og prototyping.
Test og udvikling
Syntetisk data er ideelt til software-test, prototyping og udvikling. Udviklere kan arbejde med realistiske datasæt uden at have adgang til produktionsdata, hvilket både er sikrere og mere praktisk.
Hvordan genereres syntetisk data?
Statistiske metoder
Den simpleste tilgang: analysér fordelingerne i ægte data og generer nye datapunkter fra de samme fordelinger.
Eksempel: Hvis alder i et datasæt er normalfordelt med gennemsnit 45 og standardafvigelse 12, genereres nye aldersværdier fra N(45, 12). Samme princip anvendes for alle variabler, med bevaring af korrelationer mellem dem.
Styrke: Simpelt, hurtigt, forståeligt. Svaghed: Fanger ikke komplekse, ikke-lineære mønstre i data.
Generative Adversarial Networks (GAN)
GAN’er er en af de mest brugte metoder til syntetisk data:
- Generatoren lærer at producere realistiske datapunkter
- Diskriminatoren lærer at skelne syntetisk fra ægte data
- Gennem tusindvis af iterationer forbedres generatoren, indtil diskriminatoren ikke kan skelne syntetisk fra ægte
GAN’er er særligt effektive til billeddata, tabeldata og tidsseriedata.
Variational Autoencoders (VAE)
VAE’er komprimerer ægte data til et latent rum og lærer at generere nye datapunkter fra dette rum. De er gode til at producere varierede og realistiske data, men kan være mindre skarpe end GAN-genererede data.
Diffusion models
Nyere diffusion-baserede metoder (samme teknologi bag Stable Diffusion) kan generere højkvalitets syntetisk data, særligt billeder og strukturerede data. De er ofte mere stabile at træne end GAN’er.
Regelbaseret generering
For strukturerede data kan regler og domæneviden bruges til at generere syntetisk data. F.eks.: “Generer transaktioner hvor beløbet følger en log-normalfordeling, tidspunktet er vægtet mod hverdage kl. 9-17, og 0,5% er svindel med beløb over 10.000 kr.”
Large Language Models (LLM)
LLM’er som GPT-4 og Claude kan generere syntetisk tekstdata: kundehenvendelser, produktanmeldelser, medicinske notater og lignende. De kan også generere tabeldata baseret på beskrivelser af ønskede karakteristika.
Typer af syntetisk data
Fuldt syntetisk data
Genereret helt fra bunden uden direkte kobling til specifikke ægte datapunkter. Bevarer de overordnede statistiske egenskaber men har ingen én-til-én forbindelse til ægte observationer.
Delvist syntetisk data
Ægte data hvor specifikke variabler er erstattet med syntetiske værdier. F.eks. patientjournaler hvor navne, CPR-numre og adresser er erstattet med fiktive værdier, mens kliniske data bevares.
Hybrid data
Kombination af ægte og syntetisk data. Ægte data suppleres med syntetisk data for at øge datasættets størrelse, balancere klasser eller dække manglende scenarier.
Praktiske eksempler
Eksempel 1: Syntetisk data i sundhed
Et hospital vil udvikle en AI til tidlig detektion af sepsis, men har kun 2.000 patientjournaler. For få til at træne en pålidelig model.
Løsning:
- De 2.000 ægte journaler analyseres for statistiske mønstre
- En GAN trænes til at generere syntetiske journaler med realistiske fordelinger af vitale tegn, laboratorieværdier og tidsmæssige forløb
- 50.000 syntetiske journaler genereres, med bevaring af de kliniske korrelationer fra de ægte data
- Modellen trænes på kombinationen af ægte og syntetisk data
- Validering sker udelukkende på ægte data for at sikre klinisk relevans
Resultat: Modellen opnår signifikant bedre performance end med de 2.000 ægte journaler alene, og ingen patienters data er kompromitteret.
Eksempel 2: Svindeldetektion i finans
En bank vil forbedre sin AI-baserede svindeldetektion, men svindeltilfælde udgør kun 0,1% af transaktionerne. Et enormt skævt datasæt.
Løsning:
- De eksisterende svindeltransaktioner analyseres for mønstre
- Syntetisk data genererer tusindvis af realistiske svindeltransaktioner med variationer i beløb, tidspunkt, geografi og metode
- Datasættet balanceres så modellen bedre kan lære svindelmønstre
- Modellen testes på ægte, ubalanceret data for at validere performance
Resultat: Modellens evne til at fange svindel forbedres markant uden at generere falsk positive.
Eksempel 3: Autonom kørsel
Selvkørende biler kræver data fra millioner af situationer, herunder sjældne og farlige scenarier der er umulige at indsamle sikkert i den virkelige verden.
Løsning: Simulerede køremiljøer genererer syntetisk data for:
- Fodgængere der pludselig træder ud på vejen
- Ekstreme vejrforhold (glat føre, tåge, snevejr)
- Usædvanlige vejkonfigurationer
- Situationer med andre fejlbehæftede køretøjer
Waymo, Tesla og andre selvkørende bil-virksomheder bruger milliarder af syntetisk genererede kilometer til at supplere deres ægte køredata.
Eksempel 4: Softwaretest
En virksomhed udvikler et nyt CRM-system og har brug for realistiske testdata.
Løsning: Syntetisk data genererer 100.000 kunderegistreringer med realistiske navne, adresser, ordrehistorik og interaktionsmønstre. Udviklere kan teste systemet med realistiske datamængder uden at have adgang til ægte kundedata, hvilket eliminerer risikoen for databrud under udvikling.
Kvalitetsvurdering af syntetisk data
Fidelity (troværdighed)
Hvor godt matcher den syntetiske datas statistiske egenskaber den ægte data? Metrikker inkluderer:
- Fordeling af individuelle variabler
- Korrelationer mellem variabler
- Marginale og fælles fordelinger
- Statistiske tests (Kolmogorov-Smirnov, chi-squared)
Utility (brugbarhed)
Fungerer den syntetiske data til sit formål? Den ultimative test: giver en model trænet på syntetisk data sammenlignelig performance med en model trænet på ægte data, når begge evalueres på ægte testdata?
Privacy (privatlivsbeskyttelse)
Kan den syntetiske data bruges til at afsløre information om individer i de ægte data? Risikoen for “memorisering” (at generatoren kopierer ægte datapunkter i stedet for at generere nye) skal kvantificeres og minimeres.
Metrikker inkluderer:
- Nearest-neighbor distance mellem syntetiske og ægte datapunkter
- Membership inference attacks (kan man afgøre om et ægte datapunkt var med i træningsdata?)
- Differential privacy-garantier
Begrænsninger og risici
Garbage in, garbage out
Syntetisk data er kun så godt som de ægte data det er baseret på. Hvis de ægte data indeholder fejl, bias eller mangler, vil den syntetiske data arve og potentielt forstærke disse problemer.
Falsk tryghed
Syntetisk data kan give en illusion af privatlivsbeskyttelse. Hvis generatoren “memoriserer” ægte datapunkter, kan syntetisk data indeholde genkendelige individer trods intentionen om anonymitet. Grundig privatlivsvalidering er essentiel.
Manglende edge cases
Syntetisk data tenderer mod at generere “typiske” datapunkter. Sjældne men vigtige edge cases i de ægte data kan være underrepræsenteret i syntetisk data. Netop de tilfælde der ofte er mest kritiske.
Validering kræver ægte data
For at vurdere kvaliteten af syntetisk data er der brug for ægte data som reference. Det skaber et paradoks: hvis man havde nok ægte data til grundig validering, havde man måske ikke brug for syntetisk data.
Regulatorisk usikkerhed
Selvom syntetisk data generelt vurderes som ikke-persondata under GDPR, er der gråzoner. Hvis syntetisk data kan bruges til at re-identificere individer, kan det alligevel være omfattet af databeskyttelsesregler.
Ofte stillede spørgsmål
Hvad er syntetisk data?
Syntetisk data er kunstigt genererede data der statistisk ligner ægte data, men ikke stammer fra virkelige observationer eller hændelser. Det genereres typisk af AI-modeller (som GAN’er) eller statistiske metoder og bruges til at træne maskinlæringsmodeller, teste software eller udføre analyser når ægte data er utilgængeligt, begrænset eller underlagt privatlivsbegrænsninger.
Er syntetisk data anonymt?
Syntetisk data er per design ikke afledt af specifikke individer og betragtes generelt som ikke-persondata under GDPR. Men der er en vigtig nuance: hvis den generative model har “memoriseret” ægte datapunkter, kan syntetisk data potentielt indeholde genkendelig information. Kvalitetssikring med privatlivsvalidering er derfor essentiel for at sikre at syntetisk data reelt er anonymt.
Hvornår bør man bruge syntetisk data?
Syntetisk data er mest nyttigt når ægte data er utilgængeligt på grund af privatlivshensyn (sundhed, finans), når datasættet er for lille eller skævt (sjældne sygdomme, svindeltilfælde), når man har brug for realistiske testdata uden at eksponere produktionsdata, eller når man vil korrigere for bias i eksisterende data. Det bør altid valideres mod ægte data, og kritiske modeller bør ikke udelukkende trænes på syntetisk data.
Kan syntetisk data erstatte ægte data helt?
I de fleste tilfælde nej. Syntetisk data er mest effektivt som supplement til ægte data: det udvider datasættet, balancerer klasser og muliggør privatlivssikker udvikling. Men modeller trænet udelukkende på syntetisk data risikerer at misse vigtige mønstre og edge cases fra den virkelige verden. Validering og test bør altid ske på ægte data for at sikre at modellen fungerer i praksis.