AI Ordbog
Synthetic data generation
Processen med at skabe kunstige data der statistisk ligner rigtige data, brugt til at træne AI-modeller når ægte data er begrænset, følsomt eller skævt.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026Indhold
Hvad er synthetic data generation?
Synthetic data generation er processen med at skabe kunstige data der statistisk ligner rigtige data, men som ikke stammer fra virkelige observationer. De genererede data bevarer de vigtige mønstre, fordelinger og sammenhænge fra ægte data, uden at indeholde faktiske personoplysninger, forretningshemmeligheder eller andre følsomme informationer.
Tænk på det som forskellen mellem et portræt af en rigtig person og et AI-genereret ansigt. Det AI-genererede ansigt ser realistisk ud, har korrekte proportioner og naturlige træk, men det tilhører ingen virkelig person. På samme måde kan syntetiske patientjournaler have realistiske diagnoser, medicineringer og forløb uden at repræsentere nogen faktisk patient.
Synthetic data generation er blevet en af de vigtigste teknikker i moderne AI, fordi den løser et fundamentalt problem: AI-modeller kræver enorme mængder data for at lære, men rigtige data er ofte utilstrækkeligt, følsomt, dyrt at indsamle eller skævt fordelt.
Hvorfor generere syntetiske data?
Datamangel
Mange AI-opgaver mangler tilstrækkelige træningsdata. En model der skal detektere en sjælden sygdom kan have adgang til tusindvis af normale billeder men kun hundrede med sygdommen. Syntetisk datagenerering kan producere tusindvis af realistiske eksempler med sygdommen og balancere datasættet.
Privatlivsbeskyttelse
Ægte data indeholder ofte personoplysninger der er reguleret af GDPR og andre privatlivslovgivninger. Sundhedsdata, finansielle transaktioner og kundeadfærd er vanskelige at bruge til AI-udvikling uden at kompromittere privatlivet. Syntetiske data bevarer de statistiske mønstre uden at indeholde oplysninger om faktiske personer.
Eksempel: Et hospital vil udvikle en AI-model til at forudsige genindlæggelser. Patientdata er GDPR-reguleret og kan ikke deles med eksterne udviklere. I stedet genererer hospitalet syntetiske patientjournaler der afspejler de reelle mønstre (aldersfordeling, diagnoser, medicinering, genindlæggelsesrater) uden at repræsentere faktiske patienter. Udviklerne kan træne modellen på de syntetiske data.
Bias-korrektion
Virkelige data afspejler virkelige skævheder. Hvis 90% af ansøgerne i et datasæt er mænd, vil en model trænet på disse data være biased mod kvinder. Syntetisk datagenerering kan skabe et balanceret datasæt der repræsenterer alle grupper ligeligt.
Cost og skalerbarhed
Indsamling af ægte data er dyrt og tidskrævende. Mærkning af data (labeling) kræver ofte domæneeksperter: radiologer der annoterer røntgenbilleder, jurister der klassificerer kontrakter. Syntetisk data kan genereres i stort omfang med automatisk mærkning til en brøkdel af prisen.
Sjældne scenarier
Nogle situationer er vigtige at træne for men sjældne i virkeligheden:
- Selvkørende biler der møder en elg på motorvejen
- Svindeldetektion af nye typer bedrageri
- Cybersikkerhed: angrebsmønstre der aldrig er set før
- Katastrofescenarier i industriel kontrol
Syntetisk data kan generere tusindvis af variationer af sjældne men kritiske scenarier.
Metoder til synthetic data generation
Regelbaserede generatorer
Den enkleste tilgang. Data genereres efter foruddefinerede regler og fordelinger:
# Generér syntetiske kundedata
import random
def generér_kunde():
return {
"alder": random.gauss(42, 15), # Normalfordelt, gennemsnit 42
"indkomst": random.lognormvariate(12.5, 0.7), # Log-normalfordelt
"by": random.choice(["København", "Aarhus", "Odense", "Aalborg"]),
"aktiv_kunde": random.random() < 0.73 # 73% er aktive
}
Fordele: Simpelt, hurtigt, fuld kontrol over fordelinger. Ulemper: Fanger ikke komplekse sammenhænge mellem variable. Kræver at man kender de korrekte fordelinger på forhånd.
Statistiske modeller
Mere avancerede metoder der lærer sammenhænge fra ægte data:
Gaussian Copulas: Modellerer sammenhænge mellem variable via deres fælles fordeling. Kan fange at høj indkomst korrelerer med højere alder og bestemte byer.
Bayesianske netværk: Modellerer kausale sammenhænge som en graf. Kan fange at diagnose påvirker medicinering, som påvirker bivirkninger, som påvirker genindlæggelse.
Fordele: Fanger reelle sammenhænge. Mere realistiske data. Ulemper: Kræver ægte data at lære fra. Komplekst at konfigurere.
Generative AI-modeller
De mest avancerede metoder bruger generative modeller til at producere syntetiske data:
GANs (Generative Adversarial Networks): To netværk (en generator og en diskriminator) konkurrerer. Generatoren producerer syntetiske data, diskriminatoren forsøger at skelne dem fra ægte data. Over tid bliver generatorens output stadig mere realistisk.
VAEs (Variational Autoencoders): Lærer en komprimeret repræsentation af data og kan generere nye datapunkter ved at sample fra denne repræsentation.
Diffusion-modeller: Bruges primært til billeder og video. Starter med tilfældig støj og fjerner gradvist støj for at producere realistiske billeder.
Store sprogmodeller (LLM’er): GPT-4, Claude og lignende modeller kan generere syntetisk tekst (kundehenvendelser, produktanmeldelser, medicinske noter, kodeeksempler) der er realistisk og varieret.
Fordele: Meget realistiske data. Kan fange komplekse mønstre. Ulemper: Kræver beregningsressourcer. Risiko for at reproducere ægte datapunkter. Sværere at kontrollere.
Simuleringsbaseret generering
Data genereres af en simulator der modellerer den fysiske eller logiske verden:
Selvkørende biler: 3D-simulerede bymiljøer med virtuelle biler, fodgængere, vejforhold og belysning. Sensorer (kameraer, LIDAR) i simulatoren producerer data der ligner ægte sensordata.
Robotter: Simulerede miljøer hvor robotter træner bevægelser og greb uden risiko for at beskadige fysisk udstyr.
Spil-engines: Unity og Unreal Engine bruges til at generere fotorealistiske billeddata med perfekt mærkning (hvert pixel er automatisk klassificeret).
Fordele: Perfekt kontrol over scenarier. Automatisk mærkning. Uendelig variation. Ulemper: “Sim-to-real gap” (forskelle mellem simulering og virkelighed). Dyrt at bygge realistiske simulatorer.
Praktiske anvendelser
Sundhed og medicin
Problem: Medicinsk data er strengt reguleret og svært at dele. Sjældne sygdomme har få eksempler.
Løsning: Syntetiske patientjournaler, røntgenbilleder og laboratorieresultater. Modeller trænet på syntetiske data kan bagefter finjusteres på en lille mængde ægte data.
Eksempel: Forskning i sjældne kræfttyper med kun 50 patientcases. Syntetisk datagenerering producerer 10.000 realistiske cases med variationer i sygdomsstadie, komorbiditet og behandlingsforløb. Modellen trænet på syntetiske + ægte data performer markant bedre end på ægte data alene.
Finansiel svindeldetektion
Problem: Svindel udgør typisk under 1% af alle transaktioner. Modeller trænet på ubalancerede data overser nye svindelmønstre.
Løsning: Syntetiske svindeltransaktioner der afspejler kendte og hypotetiske mønstre. Balancerer datasættet og eksponerer modellen for flere variationer.
Selvkørende biler
Problem: Farlige scenarier (fodgænger løber ud foran bilen, glat vejbane, dårlig sigt) er sjældne og umulige at iscenesætte sikkert.
Løsning: Simulerede miljøer genererer millioner af farlige scenarier. Waymo, Tesla og andre bruger simulering som en central del af deres træningspipeline.
AI-modeltræning (LLM’er)
Problem: Modeller har brug for enorme mængder høj-kvalitets træningsdata. Offentligt tilgængelige data er begrænsede og har kvalitetsproblemer.
Løsning: Syntetiske træningsdata genereret af stærke modeller bruges til at træne eller finjustere mindre modeller. Denne teknik (kendt som distillation via syntetiske data) er bredt brugt.
Eksempel: En stærk model (f.eks. GPT-4) genererer 100.000 høj-kvalitets spørgsmål-svar-par inden for et specifikt domæne. En mindre model finjusteres på disse syntetiske data og opnår stærk performance inden for domænet til en brøkdel af træningsomkostningerne.
Softwaretest
Problem: Test af software kræver realistiske data, men produktionsdata indeholder personoplysninger og kan ikke bruges i testmiljøer.
Løsning: Syntetiske testdata der afspejler produktionsdatas kompleksitet (edge cases, store volumer, varierende formater) uden privatlivsproblemer.
Kvalitet af syntetiske data
Fidelity (troværdighed)
Syntetiske data skal statistisk ligne ægte data. Fordelingerne, korrelationerne og mønstrene skal bevares. Hvis ægte data viser at 60% af kunderne i aldersgruppen 25-35 bruger mobilapp, skal syntetiske data afspejle det samme.
Utility (brugbarhed)
Data skal være brugbare til formålet. En model trænet på syntetiske data skal performe sammenligneligt med en model trænet på ægte data. Det er den ultimative test.
Diversity (diversitet)
Syntetiske data skal dække hele det realistiske datarum. Ikke kun de mest almindelige mønstre. Edge cases og sjældne kombinationer er vigtige.
Privacy (privatlivsbeskyttelse)
Syntetiske data må ikke lække information om individer fra det originale datasæt. Det kræver formel privatlivsgaranti (typisk via differential privacy), ikke bare at data “ser anderledes ud.”
Risici og begrænsninger
Model collapse
Hvis AI-modeller trænes på syntetiske data genereret af andre AI-modeller i flere generationer, kan kvaliteten degradere. Hvert led i kæden mister nuancer og diversitet, og modellerne konvergerer mod gennemsnitlige, uinteressante outputs. Dette fænomen kaldes model collapse.
Privatlivslækage
Generative modeller kan memorere specifikke datapunkter fra deres træningsdata og reproducere dem i syntetiske data. Hvis en GAN memorerer en specifik patients journal og genererer den som “syntetisk,” er privatlivet kompromitteret. Teknikker som differential privacy og membership inference testing adresserer dette.
Sim-to-real gap
Syntetiske data fra simulatorer matcher ikke altid virkeligheden perfekt. En model trænet på simulerede røntgenbilleder kan fejle på ægte røntgenbilleder fordi teksturen, støjen og kontrasterne er subtilt forskellige. Domæneadaptation og finjustering på en lille mængde ægte data hjælper med at lukke dette gap.
Falsk tryghed
Syntetiske data kan give en falsk fornemmelse af datasikkerhed. Hvis de syntetiske data er for tæt på originalen, kan de stadig lække privatlivsoplysninger. Formel evaluering af privatlivsgarantier er nødvendig. Ikke bare visuel inspektion.
Manglende repræsentation
Syntetiske data kan kun afspejle det der er i de originale data (eller det generatoren har lært). Hvis originale data mangler repræsentation af en bestemt gruppe, kan syntetiske data arve den samme mangel. Medmindre der eksplicit kompenseres.
Værktøjer til synthetic data generation
SDV (Synthetic Data Vault): Open source Python-bibliotek til generering af syntetiske tabulære data, tidsserier og relationelle databaser.
Gretel.ai: Platform til syntetisk datagenerering med fokus på privatliv og compliance. Tilbyder flere generationsmetoder og privatlivsevaluering.
MOSTLY AI: Europæisk platform til syntetisk datagenerering med stærkt fokus på GDPR-compliance og finansielle data.
Faker: Simpelt Python-bibliotek til generering af falske men realistiske navne, adresser, telefonnumre og andre basisdata. Ikke statistisk syntetisk data men nyttigt til testdata.
Unity/Unreal Engine: Spil-engines brugt til at generere syntetiske billeddata for computer vision med perfekt automatisk mærkning.
Ofte stillede spørgsmål
Hvad er synthetic data generation?
Synthetic data generation er processen med at skabe kunstige data der statistisk ligner rigtige data uden at være kopier af faktiske datapunkter. Syntetiske data bruges til at træne AI-modeller når ægte data er utilstrækkeligt (for lidt data), følsomt (personoplysninger, GDPR), skævt (ubalancerede klasser) eller dyrt at indsamle. Metoderne spænder fra simple regelbaserede generatorer til avancerede generative AI-modeller der producerer realistiske tekster, billeder og strukturerede datasæt.
Hvornår bør man bruge syntetiske data i stedet for rigtige data?
Syntetiske data er særligt værdifulde i fire scenarier: (1) Privatliv: når data indeholder personoplysninger der ikke kan deles. (2) Datamangel: når der er for få eksempler til at træne en robust model, især for sjældne tilfælde. (3) Bias-korrektion: når rigtige data er skævt fordelt og skal balanceres. (4) Simulation: når scenarier er for farlige eller dyre at iscenesætte i virkeligheden. I praksis bruges syntetiske data ofte som supplement til ægte data, ikke som fuld erstatning.
Er syntetiske data lige så gode som rigtige data?
Det afhænger af kvaliteten af genereringsprocessen og opgaven. For mange opgaver kan modeller trænet på høj-kvalitets syntetiske data performe på niveau med modeller trænet på ægte data. I nogle tilfælde performer de bedre, fordi syntetiske data kan balanceres, renses og augmenteres. Men syntetiske data kan mangle subtile mønstre og edge cases fra virkeligheden. Den bedste tilgang er ofte at kombinere syntetiske og ægte data: træn på syntetiske data og finjuster på en mindre mængde ægte data.
Er syntetiske data GDPR-sikre?
Korrekt genererede syntetiske data kan være GDPR-sikre, fordi de ikke indeholder personoplysninger om faktiske individer. Men det kræver at genereringsprocessen garanterer privatlivsbeskyttelse, for eksempel via differential privacy. Dårligt genererede syntetiske data kan stadig lække information om individer fra det originale datasæt. Det er afgørende at evaluere privatlivsgarantierne formelt og ikke antage at data er sikre bare fordi de er “syntetiske.”