Spring til indhold
AI Ordbog

AI Ordbog

Speech-to-text (STT)

AI-teknologi der konverterer tale til skrevet tekst.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er speech-to-text?

Speech-to-text (STT) er teknologi der lytter til tale og skriver den ned som tekst. Du taler, og AI’en transskriberer. Det er det modsatte af text-to-speech: i stedet for at konvertere tekst til tale konverterer STT tale til tekst.

Du bruger sandsynligvis STT dagligt uden at tænke over det. Når du dikterer en besked på din telefon, beder Siri om at sætte en alarm, søger på Google med stemmen eller får undertekster på en YouTube-video. Det er alt sammen speech-to-text.

Moderne STT er meget præcis. OpenAI’s Whisper og Googles modeller transskriberer tale med en fejlrate der er lavere end mange menneskelige transskribenter. Selv med baggrundsstøj, accenter og fagsprog.

Hvordan fungerer STT?

Det overordnede flow

  1. Lydoptagelse. Mikrofonen optager lydbølger og konverterer dem til et digitalt signal.
  2. Preprocessing. Lyden renses: baggrundsstøj reduceres, lydniveauet normaliseres, og signalet opdeles i korte segmenter.
  3. Feature extraction. Lydsignalet konverteres til en kompakt repræsentation (typisk en mel-spectrogram der viser frekvensindholdet over tid).
  4. Akustisk model. Et neuralt netværk analyserer spectrogrammet og udleder hvilke lyde (fonemer) der tales.
  5. Sprogmodel. En sprogmodel hjælper med at vælge de mest sandsynlige ord baseret på kontekst. “Jeg vil have en is” er mere sandsynlig end “Jeg vil have en ies.”
  6. Output. Den færdige tekst med tegnsætning og eventuel taleridentifikation.

End-to-end modeller

Moderne STT-modeller som Whisper bruger en end-to-end tilgang:

  1. Én model. I stedet for separate trin (akustisk model → sprogmodel → dekodning) håndterer én stor model hele processen.
  2. Transformer-arkitektur. Encoder processerer lyden, decoder genererer teksten token for token. Ligesom en oversættelsesmodel.
  3. Multitask. Samme model kan transskribere, oversætte, identificere sprog og tilføje tegnsætning.
  4. Fordel. Simplere, mere robust og bedre til at håndtere variationer i tale.

Nøgleudfordringer

  1. Accenter og dialekter. Jysk, sjællandsk og bornholmsk lyder meget forskelligt. Modellen skal forstå dem alle.
  2. Baggrundsstøj. Tale i en café, på en byggeplads eller i en bil med åbne vinduer.
  3. Overlappende tale. Flere personer der taler samtidigt, især i møder og diskussioner.
  4. Fagsprog. Medicinske, juridiske og tekniske termer der ikke optræder i daglig tale.
  5. Kodeskift. Mennesker der skifter mellem sprog midt i en sætning: “Det var en god meeting, vi fik aligned vores priorities.”

STT-modeller og værktøjer

Whisper (OpenAI)

  1. Open source. Kan downloades og køres lokalt. Gratis.
  2. Kvalitet. Blandt de bedste STT-modeller. Konkurrerer med kommercielle løsninger.
  3. Sprog. 99 sprog inklusive dansk. Automatisk sprogdetektion.
  4. Modelvarianter. tiny, base, small, medium, large. Fra hurtig/upræcis til langsom/præcis.
  5. Funktioner. Transskription, oversættelse (tale på ét sprog → tekst på engelsk), tegnsætning, tidsstempler.
  6. Begrænsning. Ikke realtid i standardudgaven. Processerer færdige lydfiler.

Google Cloud Speech-to-Text

  1. Enterprise-grade. Høj præcision med Googles neurale modeller.
  2. Realtid. Streaming-transskription med lav latency.
  3. Funktioner. Taleridentifikation (diarization), automatisk tegnsætning, ordkonfidens-scores.
  4. Specialisering. Modeller tilpasset specifikke domæner: telefoni, video, medicinsk.
  5. Sprog. 125+ sprog og varianter.

Microsoft Azure Speech

  1. Custom Speech. Træn tilpassede modeller med dine egne data for højere præcision på dit domæne.
  2. Realtid. Streaming-transskription og batchprocessering.
  3. Integration. Dyb integration med Microsoft Teams, Office og Azure.
  4. Funktioner. Taleridentifikation, sentiment-analyse, keyword spotting.

Amazon Transcribe

  1. AWS-integration. Del af Amazon Web Services.
  2. Specialmodeller. Amazon Transcribe Medical for medicinsk transskription.
  3. Funktioner. Automatisk indholdsredigering (fjern personoplysninger), custom vocabulary.
  4. Brug. Velegnet til callcenter-transskription og medieproduktion.

AssemblyAI

  1. Udviklervenlig. Simpel API med fokus på transskription og lydforståelse.
  2. Funktioner. Transskription, opsummering, sentiment-analyse, emneidentifikation, taleridentifikation.
  3. LeMUR. Sprogmodel integreret med STT. Stil spørgsmål til dine transskriptioner.
  4. Kvalitet. Konkurrerer med Google og Azure på engelsk.

Lokale/open source alternativer

  1. Faster Whisper. Optimeret version af Whisper der kører 4x hurtigere med samme kvalitet.
  2. Vosk. Letvægts offline STT. Kører på enheder med begrænset compute.
  3. Mozilla DeepSpeech. Open source STT fra Mozilla. Mindre aktivt udviklet.

Centrale funktioner

Realtid vs. batch

Realtid (streaming)

  1. Tale transskriberes mens du taler. Teksten dukker op løbende.
  2. Kræver lav latency, typisk under 500ms forsinkelse.
  3. Bruges til: undertekster i live-tv, stemmeassistenter, realtids-mødenoter.
  4. Udfordring: modellen skal gætte kontekst med ufuldstændig information.

Batch (offline)

  1. En komplet lydfil processeres efter optagelse.
  2. Højere præcision fordi modellen kan se hele konteksten.
  3. Bruges til: podcast-transskription, mødeoptageser, medicinsk dokumentation.
  4. Fordel: kan køres lokalt, ingen internet påkrævet.

Taleridentifikation (diarization)

  1. Identificér hvem der siger hvad i en samtale med flere deltagere.
  2. Output: “Taler 1: Velkommen til mødet. Taler 2: Tak, lad os starte med punkt 1.”
  3. Fungerer bedst med 2-5 talere. Bliver upræcist med mange samtidige talere.
  4. Kombineres typisk med transskription: først transskribér, derefter tildel talere.

Tegnsætning og formatering

  1. Moderne modeller tilføjer automatisk punktummer, kommaer og spørgsmålstegn.
  2. Paragrafopdeling baseret på pauser og emnesskift.
  3. Tal konverteres: “to tusind og fireogtyve” → “2024.”
  4. Forkortelser og enheder: “femogtyve kilometer i timen” → “25 km/t.”

Tidsstempler

  1. Hvert ord eller segment får et tidsstempel: hvornår det blev sagt.
  2. Muliggør: undertekster synkroniseret med video, søgning i lydoptagelser, navigation i lange optagelser.
  3. Ordniveau: “Hej [0:01.2] velkommen [0:01.5] til [0:01.8] mødet [0:02.1].”

Custom vocabulary

  1. Tilføj virksomhedsspecifikke ord, produktnavne og fagtermer.
  2. “SageMaker” genkendes korrekt i stedet for “sage maker.”
  3. Kritisk for specialiserede domæner: jura, medicin, ingeniørfag.

Anvendelser

Mødetransskription

  1. Automatiske mødereferater. Optag mødet → STT transskriberer → AI opsummerer.
  2. Søgbare møder. “Hvornår talte vi om budget?” → søg i transskriptionen.
  3. Action items. AI udtrækker handlingspunkter fra transskriptionen automatisk.
  4. Værktøjer. Otter.ai, Fireflies.ai, Microsoft Teams (indbygget), Google Meet (indbygget).

Undertekster og captions

  1. Live undertekster. Realtids-undertekster til live-streams, konferencer og undervisning.
  2. Video-undertekster. Automatisk undertekstning af YouTube-videoer, podcasts og kurser.
  3. Tilgængelighed. Gør lydindhold tilgængeligt for døve og hørehæmmede.
  4. Flersprogede undertekster. STT + maskinoversættelse: tale på dansk → undertekster på engelsk.

Callcenter og kundeservice

  1. Samtaletransskription. Alle telefonsamtaler transskriberes automatisk.
  2. Kvalitetskontrol. AI analyserer transskriptioner for compliance, kundetilfredshed og medarbejderperformance.
  3. Søgbarhed. Find alle samtaler om et specifikt emne eller produkt.
  4. Realtids-assistance. AI lytter med og foreslår svar til agenten i realtid.

Medicinsk dokumentation

  1. Diktering. Lægen dikterer noter → STT transskriberer → struktureret journalnotat.
  2. Specialmodeller. Medicinsk STT forstår fagtermer: “acetylsalicylsyre,” “inferior vena cava,” “bilateral pneumoni.”
  3. Tidsbesparelse. Læger bruger op til 2 timer dagligt på dokumentation. STT kan halvere det.

Medieproduktion

  1. Podcast-transskription. Generér transskription for SEO og tilgængelighed.
  2. Interview-transskription. Journalister og forskere transskriberer interviews automatisk.
  3. Søgbar mediearchiv. Transskribér tusindvis af timers arkivmateriale og gør det søgbart.

Stemmeinterfaces

  1. Stemmeassistenter. Siri, Alexa, Google Assistant. STT er det første trin i at forstå din stemmekommando.
  2. Stemmestyring. “Tænd lyset i stuen.” STT konverterer tale til tekst → NLU forstår hensigten → kommandoen udføres.
  3. Diktering. Diktér emails, beskeder og dokumenter i stedet for at skrive.

STT i praksis

Eksempel: automatiserede mødereferater

  1. Situation. Et konsulentfirma holder 50 kundemøder ugentligt. Manuelt referat tager 30 minutter per møde.
  2. Løsning. Optag med Teams/Zoom → Whisper transskriberer → GPT-4 opsummerer med nøglebeslutninger og action items.
  3. Resultat. Referater klar 5 minutter efter mødet i stedet for 24 timer. 25 timers ugentlig besparelse.
  4. Kvalitet. 95% korrekt transskription. AI-opsummeringen reviewes af mødelederen.

Eksempel: podcast SEO

  1. Situation. En podcast med 200 episoder. Ingen transskription = usynlig for søgemaskiner.
  2. Løsning. Batch-transskribér alle episoder med Whisper. Publicér transskriptionerne på hjemmesiden.
  3. Resultat. Organisk trafik stiger 40% fordi søgemaskiner nu kan indeksere podcastens indhold.
  4. Omkostning. Whisper lokalt: gratis (kun compute). Cloud-API: ~$0.006/minut.

Eksempel: callcenter-analyse

  1. Situation. Et forsikringsselskab modtager 5.000 opkald dagligt. Kvalitetskontrol er stikprøvebaseret: kun 2% af opkald reviewes.
  2. Løsning. Transskribér alle 5.000 opkald med Amazon Transcribe. AI analyserer for compliance, sentiment og emner.
  3. Resultat. 100% af opkald analyseret. Compliance-overtrædelser opdages automatisk. Kundetilfredsheds-trends identificeres i realtid.

Dansk STT

Udfordringer

  1. Udtale vs. skrift. Dansk har stor forskel mellem skrevet og talt sprog. “Jeg hedder” udtales ofte “Ja hejr.”
  2. Stød. Det danske stød er svært at modellere og skelne fra lignende lyde.
  3. Vokaler. Dansk har usædvanligt mange vokallyde. Forveksling mellem lignende vokaler er almindelig.
  4. Begrænset data. Langt mindre træningsdata tilgængeligt end for engelsk. Kvaliteten er mærkbart lavere.

Status

  1. Whisper large-v3 er det bedste open source-valg for dansk. God men ikke perfekt.
  2. Google og Azure har gode danske modeller, bedre end Whisper for realtid.
  3. Fagsprog og navne er stadig en udfordring. Custom vocabulary hjælper.
  4. Kvaliteten forbedres løbende, men engelsk er stadig markant foran.

Præcision og fejltyper

Word Error Rate (WER)

Det primære mål for STT-kvalitet:

  1. Definition. Procentdel af ord der er forkerte (indsættelser + sletninger + erstatninger / totalt antal ord).
  2. God WER. Under 5% for klar tale på engelsk. Under 10% for dansk.
  3. Menneskelig WER. Selv menneskelige transskribenter har 4-5% fejlrate.

Typiske fejl

  1. Homofoner. “De” vs. “det”, lyder ens, skrives forskelligt.
  2. Navne. Personnavne og firmanavne genkendes ofte forkert.
  3. Tal. “Femten” vs. “halvtreds”, kan forveksles i støjende omgivelser.
  4. Fagtermer. Sjældne ord der ikke var i træningsdata.
  5. Talestart og -stop. De første og sidste ord i en sætning er svære at fange.

Privatliv og sikkerhed

Databehandling

  1. Cloud-STT. Lyden sendes til cloud-servere for processering. Vigtigt at forstå udbydernes datapolitik.
  2. Lokal STT. Whisper og Vosk kan køre lokalt. Ingen data forlader din maskine.
  3. GDPR. Taleoptagelser er persondata. Kræver lovligt grundlag, formål og opbevaringspolitik.

Følsomme optagelser

  1. Lægekonsultationer, advokat-klient samtaler, personalesamtaler. Alt kræver særlig opmærksomhed.
  2. Automatisk redigering: nogle STT-tjenester kan fjerne CPR-numre, kreditkortnumre og andre personoplysninger fra transskriptionen.
  3. Opbevaringspolitik: hvornår slettes optagelser og transskriptioner?

STT har gjort tale til søgbar, analyserbar data Før STT var tale flygtig. Den eksisterede i øjeblikket og forsvandt. Optagelser hjalp, men at finde et specifikt punkt i en times optagelse krævede at lytte hele vejen igennem. STT ændrer dette fundamentalt: tale bliver til tekst, tekst bliver søgbar, og søgbar tekst kan analyseres med alle de værktøjer vi allerede har til tekstdata. Hvert møde, hvert opkald, hver podcast og hver forelæsning kan nu transskriberes, søges i, opsummeres og analyseres automatisk. Det er ikke bare en bekvemmelighed. Det ændrer grundlæggende hvordan vi arbejder med information der startede som tale.


FAQ

Hvad er speech-to-text (STT)?

Speech-to-text er AI-teknologi der konverterer tale til skrevet tekst. Du taler eller afspiller en lydoptagelse, og AI'en producerer en transskription. Det bruges til mødereferater, undertekster, diktering, stemmeassistenter og analyse af telefonsamtaler. Moderne STT bruger dybe neurale netværk og er næsten lige så præcis som menneskelige transskribenter.

Hvilken speech-to-text er bedst?

For offline/batch-processering er OpenAI's Whisper (open source, gratis) blandt de bedste med support for 99 sprog. For realtid er Google Cloud Speech-to-Text og Azure Speech førende med lav latency og enterprise-features. For dansk er Whisper large-v3 det bedste open source-valg, mens Google og Azure er bedre til realtid.

Hvad er forskellen på speech-to-text og text-to-speech?

Speech-to-text (STT) konverterer tale til tekst: du taler, AI'en skriver. Text-to-speech (TTS) gør det modsatte og konverterer tekst til tale: du skriver, AI'en taler. Begge er centrale teknologier i stemmeassistenter, tilgængelighed og multimodal AI.

Hvor præcis er speech-to-text?

Moderne STT har en fejlrate (WER) på 3-5% for klar tale på engelsk. Det er sammenlignelig med menneskelige transskribenter. For dansk er fejlraten typisk 8-15% afhængigt af lydkvalitet, accent og domæne. Præcisionen falder med baggrundsstøj, overlappende tale og fagsprog. Custom vocabulary og domænetilpassede modeller forbedrer resultatet markant.


Relaterede termer