Spring til indhold
AI Ordbog

AI Ordbog

Text-to-speech (TTS)

AI-teknologi der konverterer tekst til naturligt klingende tale.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er text-to-speech?

Text-to-speech (TTS) er teknologi der læser tekst højt. Den konverterer skrevne ord til tale. Du giver den en tekst, og den producerer en lydfil med en stemme der læser teksten op.

Det lyder simpelt, men moderne TTS er bemærkelsesværdig. Hvor tidlige syntetiske stemmer lød robotagtige og mekaniske, producerer nutidens AI-drevne TTS stemmer der er næsten umulige at skelne fra rigtige mennesker. De har naturlig intonation, passende pauser, følelsesmæssig nuance og kan endda tilpasse sig konteksten: en spørgsmålssætning lyder anderledes end en konstatering.

TTS er overalt: din telefons stemmeassistent, GPS-navigation, oplæsning af artikler, tilgængelighed for synshæmmede, automatiserede telefonmenuer, podcasts genereret fra tekst, og AI-assistenter der taler med dig i realtid.

Hvordan fungerer moderne TTS?

Det overordnede flow

  1. Tekstanalyse. Analyser teksten: find sætningsgrænser, genkend forkortelser (f.eks. “kr.” → “kroner”), tal (2024 → “to tusind og fireogtyve”), og tegnsætning.
  2. Lingvistisk processing. Bestem udtale, betoning og prosodi. “Læs” (imperativ af “at læse”) udtales anderledes end “læs” (datid af “at lægge”). Konteksten afgør.
  3. Akustisk model. Konvertér den lingvistiske repræsentation til en akustisk repræsentation: en spectrogram der beskriver lydens frekvenser over tid.
  4. Vocoder. Konvertér spectrogrammet til faktisk lyd: en lydbølge der kan afspilles.

Neurale TTS-modeller

Moderne TTS bruger dybe neurale netværk i alle trin:

  1. Encoder. Konverterer tekst til en intern repræsentation der fanger mening, syntaks og prosodi.
  2. Decoder. Genererer en mel-spectrogram (en visuel repræsentation af talens lydfrekvenser).
  3. Vocoder. Konverterer spectrogrammet til lyd. Moderne vocodere som HiFi-GAN producerer krystalklare lydbølger.

Nøgleudfordringer

  1. Prosodi. Naturlig tale har rytme, melodi og tempo der varierer med indhold og følelse. AI’en skal forstå hvornår man lægger tryk, holder pause og ændrer toneleje.
  2. Homografer. Ord der skrives ens men udtales forskelligt: “de fire vinde” vs. “han vil vinde.” Modellen skal forstå konteksten.
  3. Følelse. En sætning kan siges glad, trist, spørgende eller sarkastisk. Moderne modeller kan styre dette.
  4. Flersprogethed. Korrekt udtale af fremmedord, navne og kodeskift mellem sprog.

TTS-modeller og værktøjer

ElevenLabs

  1. Kvalitet. Blandt de bedste stemmer på markedet. Naturlig, menneskelig klang.
  2. Stemmekloning. Upload et kort stemmeklip → ElevenLabs skaber en syntetisk version af den stemme.
  3. Sprog. 29+ sprog inklusive dansk.
  4. Brug. Web, API, browser-extension. Abonnement fra $5/md.
  5. Populær til. Podcasts, lydbøger, videonarration, tilgængelighed.

OpenAI TTS

  1. Integreret. Del af OpenAI’s API.
  2. Modeller. tts-1 (hurtig, billigere), tts-1-hd (højere kvalitet) og gpt-4o-mini-tts (nyeste, med instruérbar stil).
  3. Stemmer. 13 indbyggede stemmer plus custom voices.
  4. Styrke. Simpel API, god kvalitet, lav pris. Velegnet til integration i applikationer.
  5. Realtid. Understøtter streaming for lav-latency tale.

Google Cloud TTS

  1. WaveNet og Neural2. Googles neurale stemmer med høj kvalitet.
  2. Sprog. 40+ sprog med hundredvis af stemmer.
  3. SSML. Detaljeret kontrol via Speech Synthesis Markup Language: pauser, hastighed, tonehøjde, betoning.
  4. Styrke. Enterprise-grade pålidelighed. Dyb integration med Google Cloud.

Amazon Polly

  1. AWS-integration. Del af Amazon Web Services.
  2. Neural og standard. Neurale stemmer for høj kvalitet, standardstemmer for lav pris.
  3. Sprog. 30+ sprog.
  4. Styrke. Skalerbarhed, lav latency, pay-per-use prising.

Microsoft Azure Speech

  1. Stor stemmecollection. Hundredvis af neurale stemmer på tværs af sprog.
  2. Custom Neural Voice. Træn en custom stemme med dine egne lyddata.
  3. SSML og visemes. Avanceret kontrol inklusive lip-sync data for avatarer.
  4. Styrke. Enterprise-features, compliance, integreret med Microsoft-økosystemet.

Coqui TTS / Open source

  1. Open source. Kør TTS lokalt med fuld kontrol. Coqui-virksomheden lukkede i 2023, men projektet vedligeholdes som open source af Idiap Research Institute.
  2. XTTS. Multi-lingual stemmekloning med kun få sekunders referencelyd.
  3. Fordel. Gratis, privat, tilpasseligt. Ingen data sendes til cloud.
  4. Begrænsning. Kræver teknisk opsætning. Kvaliteten er typisk lidt under de kommercielle løsninger.

Stemmekloning

En af de mest omdiskuterede funktioner i moderne TTS:

Hvordan det fungerer

  1. Input. Upload 1-30 minutter af en persons tale.
  2. Analyse. AI’en analyserer stemmens karakteristika: klangfarve, tonehøjde, tempo, accent, vejrtrækningsmønstre.
  3. Model. En stemmemodel skabes der kan sige hvad som helst med den klonede stemme.
  4. Kvalitet. Mere referencedata = bedre kloning. 30 sekunder giver en rimelig stemme. 10 minutter giver en overbevisende stemme.

Instant voice cloning

Nyere modeller kan klone en stemme fra bare 3-15 sekunders lyd:

  1. Upload et kort klip.
  2. Modellen fanger de mest karakteristiske træk.
  3. Kvaliteten er lavere end med mere data men stadig imponerende.

Etiske overvejelser

  1. Samtykke. Stemmekloning uden personens tilladelse er etisk problematisk og potentielt ulovligt.
  2. Svindel. Klonede stemmer kan bruges til telefonsvindel: “Hej mor, jeg har brug for penge.”
  3. Deepfake-lyd. Politikere og offentlige personer kan få lagt ord i munden.
  4. Sikkerhedsforanstaltninger. Seriøse platforme kræver samtykke-verifikation og har misbrugspolitikker.

Anvendelser

Tilgængelighed

  1. Synshæmmede. Skærmlæsere bruger TTS til at læse alt indhold op: websites, emails, dokumenter.
  2. Læsevanskeligheder. Dyslektikere kan lytte til tekster i stedet for at læse dem.
  3. Sprogindlæring. Hør hvordan ord og sætninger udtales korrekt.
  4. Lovkrav. Mange jurisdiktioner kræver at digitalt indhold er tilgængeligt. TTS er en nøgleteknologi.

Medier og indhold

  1. Podcasts. Konvertér blogindlæg og artikler til podcasts automatisk.
  2. Lydbøger. Producér lydbøger uden at hyre en indlæser. Timers studietid reduceret til minutter.
  3. Videonarration. Voice-over til YouTube-videoer, tutorials og præsentationer.
  4. Nyhedsoplæsning. Aviser og nyhedssites tilbyder oplæsning af artikler.

Kundeservice og telefoni

  1. IVR (Interactive Voice Response). Automatiske telefonmenuer med naturlige stemmer.
  2. Automatiserede opkald. Påmindelser om aftaler, leveringsnotifikationer, undersøgelser.
  3. Chatbot med stemme. Kombiner en LLM-chatbot med TTS for en samtalende AI-agent.

AI-assistenter

  1. Stemmeassistenter. Siri, Alexa og Google Assistant bruger TTS til at svare mundtligt.
  2. Konversationel AI. ChatGPT’s stemmefunktion bruger TTS til realtids-samtale.
  3. Virtuelle avatarer. Digitale mennesker der taler med TTS-genereret stemme og lip-synced animation.

Virksomhedsbrug

  1. E-learning. Generer talte instruktioner til online kurser. Opdater indhold uden genindspilning.
  2. Intern kommunikation. Konvertér skriftlige opdateringer til lydmeddelelser for travle medarbejdere.
  3. Lokalisering. Oversæt og indtal produktvideoer til 20 sprog med AI-stemmer.

TTS i praksis

Eksempel: podcast fra blogindlæg

  1. Input. En 2.000-ords blogartikel.
  2. Proces. Indsæt teksten i ElevenLabs, vælg en stemme, justér hastighed og pauser.
  3. Output. En 12-minutters lydfil klar til upload som podcast-episode.
  4. Tid. 5 minutter i stedet for 2 timers indspilning og redigering.
  5. Kvalitet. Professionelt klingende. Men mangler den personlige forbindelse fra en menneskelig vært.

Eksempel: flersprogede produktvideoer

  1. Situation. En dansk virksomhed lancerer et produkt i 10 markeder.
  2. Traditionelt. 10 voice-over kunstnere, 10 studiesessioner, koordinering og quality control. Uger og store omkostninger.
  3. Med TTS. Oversæt scriptet til 10 sprog. Generer voice-over med passende stemmer for hvert sprog via API.
  4. Resultat. 10 lokaliserede videoer på én dag. Væsentligt billigere.
  5. Tradeoff. Kvaliteten er god men ikke på niveau med en professionel speaker for de mest krævende markeder.

Eksempel: tilgængelig hjemmeside

  1. Krav. En offentlig institution skal gøre sit indhold tilgængeligt.
  2. Løsning. TTS-widget på hjemmesiden: klik “Lyt” på enhver artikel.
  3. Implementation. API-integration med Google Cloud TTS eller Azure Speech.
  4. Resultat. Alle borgere kan tilgå information uanset læseevne eller synshandicap.

Kvalitet og naturalighed

Hvad gør en TTS-stemme naturlig?

  1. Prosodi. Naturlig rytme og melodi. Spørgsmål stiger i tonehøjde. Oplistninger har en bestemt rytme. Vigtige ord betones.
  2. Pauser. Passende pauser ved kommaer, punktummer og mellem afsnit. Ikke for korte (robotagtig), ikke for lange (unaturlig).
  3. Coarticulation. Lyde påvirker hinanden. “N” i “en bog” lyder anderledes end “n” i “en kat” fordi munden forbereder sig på den næste lyd.
  4. Vejrtrækning. Naturlige indåndinger mellem sætninger. Deres fravær gør stemmer umiddelbart unaturlige.
  5. Variation. Ingen to sætninger siges helt ens. Minimal variation gør stemmen monoton.

Kvalitetsforskelle

FunktionÆldre TTSModerne neural TTS
NaturalighedRobotagtigNæsten menneskelig
FølelseIngenKan udtrykke glæde, alvor, empati
ProsodiRegelbaseret, stivKontekstbevidst, flydende
VejrtrækningIngenNaturlige indåndinger
HastighedFastVariabel, naturlig

Kontrol over TTS-output

SSML (Speech Synthesis Markup Language)

Et markup-sprog der giver fin kontrol over talen:

  1. Pauser. <break time="500ms"/>: indsæt en halv sekunds pause.
  2. Betoning. <emphasis level="strong">vigtigt</emphasis>: betoning af et ord.
  3. Hastighed. <prosody rate="slow">: langsom tale.
  4. Tonehøjde. <prosody pitch="high">: højere stemmeleje.
  5. Udtale. <phoneme alphabet="ipa" ph="ˈkøːbm̩ˌhɑwn">København</phoneme>: præcis udtale.

Prompt-baseret kontrol

Nyere modeller tillader instruktioner i naturligt sprog:

  1. “Læs denne tekst som en nyhedsoplæser.”
  2. “Sig dette med en varm, beroligende tone.”
  3. “Læs dette hurtigt og energisk.”

Dansk TTS

Udfordringer med dansk

  1. Stød. Det danske stød er svært at reproducere korrekt. Det er et unikt fonetisk træk.
  2. Vokalrigdom. Dansk har mange vokallyde (flere end de fleste sprog). Korrekt reproduktion kræver detaljeret akustisk modellering.
  3. Udtalevariation. Stor forskel mellem skriftsprog og talesproget. “Jeg hedder” udtales ofte “Ja hejr.”
  4. Begrænset træningsdata. Mindre data tilgængelig end for engelsk. Kvaliteten af danske stemmer er typisk lavere.

Status

  1. Engelske stemmer er markant bedre end danske i de fleste TTS-systemer.
  2. ElevenLabs og Azure har de bedste danske stemmer.
  3. Kvaliteten forbedres hurtigt. Men der er stadig et gap til engelsk.

Etik og regulering

Voice deepfakes

  1. TTS-stemmekloning muliggør overbevisende stemmeefterligninger.
  2. Kan bruges til svindel, misinformation og chikane.
  3. Regulering er under udvikling: EU AI Act adresserer syntetisk tale.

Samtykke og rettigheder

  1. Hvem ejer en stemme? Kan din stemme klones uden dit samtykke?
  2. Skuespillere og voice-over kunstnere kæmper for stemmebeskyttelse.
  3. Lovgivning er stadig i tidlig fase i de fleste lande.

Transparens

  1. Bør syntetisk tale altid mærkes som AI-genereret?
  2. I mange kontekster (kundeservice, medier) er det etisk nødvendigt.
  3. Tekniske løsninger: audio watermarks der identificerer AI-genereret tale.

TTS har gjort den menneskelige stemme digital I årtier lød syntetisk tale som en maskine. Moderne TTS har ændret det fundamentalt. AI-genererede stemmer kan nu udtrykke varme, humor, alvor og empati. Det åbner enorme muligheder: enhver tekst kan blive til tale, ethvert sprog kan tales, og indhold kan tilgås af alle uanset læseevne. Men den samme teknologi der gør tilgængelighed mulig, gør også stemmebedrageri nemmere. Ansvarlig brug af TTS kræver at vi balancerer fordelene (demokratisering af indhold, tilgængelighed, effektivitet) med reelle risici for misbrug. Teknologien er her. Spørgsmålet er hvordan vi bruger den.


FAQ

Hvad er text-to-speech (TTS)?

Text-to-speech er teknologi der konverterer skrevet tekst til tale. Du giver den en tekst, og den producerer en lydfil med en stemme der læser teksten op. Moderne AI-drevet TTS producerer stemmer der er næsten umulige at skelne fra rigtige mennesker, med naturlig intonation, pauser og følelse.

Hvilken TTS er bedst?

ElevenLabs producerer generelt den højeste stemmekvalitet med stemmekloning og 29+ sprog. OpenAI TTS er simpel at integrere via API med god kvalitet. Google Cloud TTS og Azure Speech er enterprise-grade med flest sprog og stemmer. For dansk er ElevenLabs og Azure de bedste valg. Det rette værktøj afhænger af behov: kvalitet, pris, sprog og integration.

Kan AI klone en stemme?

Ja. Moderne TTS-systemer som ElevenLabs kan klone en stemme fra så lidt som 15 sekunders lyddata. Jo mere referencedata, desto bedre resultat. Stemmekloning rejser etiske spørgsmål om samtykke og misbrug, og seriøse platforme kræver verifikation af at du har tilladelse til at klone stemmen.

Er AI-genereret tale gratis?

Nogle TTS-tjenester har gratis niveauer med begrænsninger: Google Cloud TTS tilbyder 1 million tegn gratis per måned. Open source-modeller som Coqui TTS er helt gratis at køre lokalt. Kommercielle tjenester som ElevenLabs starter fra $5/md. For professionel brug med høj volumen er et betalt abonnement typisk nødvendigt.


Relaterede termer