Spring til indhold
AI Ordbog

AI Ordbog

Semantic search (AI-søgning)

AI-søgning der forstår betydningen bag ordene i stedet for kun at matche nøgleord.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 22. maj 2026

Indhold

Semantic search er søgning der forstår hvad du mener, ikke bare hvad du skriver. Traditionel søgning matcher ordene i din søgning mod ordene i dokumenter. Semantic search forstår betydningen af din søgning og finder dokumenter med samme betydning, uanset om de bruger de samme ord.

Forestil dig at du søger efter “hvordan håndterer man en vanskelig kollega.” Traditionel søgning leder efter dokumenter der indeholder ordene “vanskelig” og “kollega.” Semantic search forstår at du leder efter rådgivning om konflikthåndtering på arbejdspladsen og kan finde artikler om “professionel kommunikation i svære situationer” eller “samarbejdsproblemer og løsninger”, selvom ingen af disse indeholder dine søgeord.

Traditionel søgning (nøgleordssøgning)

  1. Sådan virker det. Matcher ordene i søgningen mod ordene i dokumenter. Bruger algoritmer som BM25 og TF-IDF der vægter ord efter hyppighed og relevans.
  2. Styrker. Hurtig, præcis for specifikke termer (produktnavne, koder, ID’er), velforstået teknologi.
  3. Svagheder. Forstår ikke synonymer, kontekst eller hensigt. “Billig flyrejse” finder ikke “budget-flybillet.” Flertydig: “jaguar” returnerer både bilen og dyret.
  1. Sådan virker det. Konverterer søgning og dokumenter til embeddings (numeriske repræsentationer af betydning) og finder dokumenter med lignende embeddings.
  2. Styrker. Forstår synonymer, kontekst og hensigt. Finder relevante resultater selvom ordene er forskellige.
  3. Svagheder. Kan misse præcise termer (et produktnavn, en paragraf-reference). Mere ressourcekrævende.
SøgningTraditionelSemantic
“billige flyrejser til Spanien”Kun dokumenter med “billige” + “flyrejser” + “Spanien”Også “budget-flybilletter til Barcelona,” “lavpris-fly Mallorca”
“ondt i hovedet”Dokumenter med “ondt” + “hovedet”Også “hovedpine,” “migræne,” “spændingshovedpine”
“GDPR artikel 17”Præcis match, fungerer godtKan misse den præcise reference
“hvordan motiverer man et team”Kun dokumenter med disse ordOgså “ledelse og medarbejderengagement,” “teambuilding-strategier”

Trin 1: Indeksering (forberedelse)

  1. Alle dokumenter opdeles i chunks (passende tekststykker, typisk 200-500 tokens).
  2. Hver chunk sendes gennem en embedding-model der konverterer teksten til en vektor (en liste af tal der repræsenterer betydningen).
  3. Vektorerne gemmes i en vector database sammen med metadata (dokumenttitel, kilde, dato).

Trin 2: Søgning

  1. Brugeren skriver en søgning.
  2. Søgningen konverteres til en vektor via den samme embedding-model.
  3. Vector databasen finder de chunks hvis vektorer er tættest på søge-vektoren (nearest neighbor search).
  4. De mest lignende chunks returneres som søgeresultater, sorteret efter relevans.

Trin 3: Relevans-scoring

Ligheden mellem to vektorer måles typisk med:

  1. Cosine similarity. Måler vinklen mellem to vektorer. Score fra 0 (ingen lighed) til 1 (identisk betydning). Det mest brugte mål.
  2. Dot product. Hurtigt og effektivt. Bruges ofte internt i systemer.
  3. Euklidisk afstand. Måler den direkte afstand mellem to punkter i vektorrummet.

Hybrid søgning: det bedste fra begge verdener

I praksis kombinerer de bedste søgesystemer traditionel og semantisk søgning:

  1. Semantisk søgning finder dokumenter med lignende betydning. Fanger synonymer, omskrivninger og relaterede koncepter.
  2. Nøgleordssøgning (BM25) finder dokumenter med præcise termer. Afgørende for produktnavne, koder, juridiske referencer og tekniske termer.
  3. Reciprocal Rank Fusion (RRF) eller andre metoder kombinerer resultaterne og rangerer dem samlet.

Eksempel: en bruger søger “Apple M4 chip benchmark.” Semantisk søgning finder artikler om “ydelsestest af Apples nyeste processor.” Nøgleordssøgning finder artikler der nævner “M4” og “benchmark” eksplicit. Hybrid søgning returnerer begge typer resultater, rangeret efter samlet relevans.

Semantic search i praksis

Virksomhedens vidensbase

  1. Problemet. 10.000 interne dokumenter (policies, guides, FAQs) der er svære at finde med nøgleordssøgning fordi medarbejdere bruger forskellige termer.
  2. Løsningen. Dokumenterne indekseres med embeddings. Medarbejdere søger naturligt: “Hvad er reglerne for at tage fri på en fredag?” og finder relevante HR-dokumenter, uanset om de hedder “Flex-fridage,” “Afspadsering” eller “Feriepolitik.”
  3. Resultatet. Medarbejdere finder svar hurtigere, færre support-henvendelser til HR.

E-commerce produktsøgning

  1. Problemet. Kunder beskriver hvad de leder efter med deres egne ord, som sjældent matcher produktbeskrivelserne præcist.
  2. Løsningen. Produktbeskrivelser konverteres til embeddings. Kunden søger “noget til at beskytte min telefon mod stød” og finder covers, bumpers og beskyttelsesglas, selvom ingen af produktnavnene indeholder “beskytte” eller “stød.”
  3. Resultatet. Flere relevante søgeresultater, højere konverteringsrate, færre “ingen resultater”-sider.

Kundesupport

  1. Problemet. Kunder beskriver deres problemer med egne ord. Et problem som “min bestilling er ikke kommet” kan også formuleres som “pakken mangler,” “venter stadig på levering” eller “ordren er forsinket.”
  2. Løsningen. Semantic search i support-databasen matcher alle formuleringer mod de relevante supportartikler.
  3. Resultatet. Kunder finder self-service svar hurtigere, færre tickets til supportteamet.

Juridisk research

  1. Problemet. Jurister skal finde relevante domme og lovtekster. Juridisk sprog varierer enormt. Samme koncept kan formuleres på mange måder.
  2. Løsningen. Juridiske dokumenter indekseres semantisk. En søgning efter “erstatningsansvar for mangelfuldt produkt” finder relevante domme uanset den præcise juridiske formulering.
  3. Resultatet. Hurtigere research, færre oversete relevante afgørelser.

RAG-systemer

Semantic search er den centrale komponent i RAG:

  1. Bruger stiller et spørgsmål til en AI-assistent.
  2. Semantic search finder de mest relevante dokumenter i virksomhedens data.
  3. Dokumenterne sendes som kontekst til en sprogmodel.
  4. Sprogmodellen genererer et præcist svar baseret på de fundne dokumenter.

Kvaliteten af semantic search afhænger af embedding-modellen:

  1. OpenAI text-embedding-3-small/large. Populært valg med god kvalitet. API-baseret.
  2. Cohere Embed v4. Multimodal embedding-model med stærk multilingual kvalitet. Optimeret til søgning.
  3. BGE (BAAI General Embedding). Open source med høj kvalitet. Kan køres lokalt.
  4. E5 (Microsoft). Open source, stærk til søgning, understøtter mange sprog.
  5. Sentence-BERT / all-MiniLM. Letvægts open source-modeller. Hurtige og gode til prototyping.

Vigtigt: brug den samme embedding-model til indeksering og søgning. Vektorer fra forskellige modeller er ikke kompatible.

Udfordringer

  1. Nøgleords-blindhed. Semantic search kan overse præcise termer. Hvis du søger “fejlkode E-7042” kan semantisk søgning fejle fordi den fokuserer på betydning, ikke specifikke koder. Løsning: hybrid søgning.
  2. Out-of-domain data. Embedding-modeller trænet primært på engelsk tekst kan performe dårligt på specialiserede danske fagtermer. Løsning: brug multilingual modeller eller fine-tune.
  3. Chunking-kvalitet. Dårlig opdeling af dokumenter giver dårlige embeddings og irrelevante resultater. Chunks skal være meningsfulde og selvstændige.
  4. Skalerbarhed. Millioner af dokumenter kræver en optimeret vector database og effektiv indeksering.
  5. Evaluering. Det er svært at måle objektivt om semantisk søgning er “bedre.” Det kræver relevans-bedømmelser fra mennesker.

Semantic search vs. AI-genererede svar

Semantic search og AI-genererede svar (via LLM’er) er komplementære:

  1. Semantic search finder de mest relevante dokumenter. Den er retrieval: den henter information.
  2. LLM genererer et svar baseret på de fundne dokumenter. Den er generation: den formulerer et svar.
  3. Sammen (RAG) giver de et system der både kan finde relevant information og formulere et klart, sammenhængende svar.

Google, Bing og Perplexity bruger alle denne kombination: semantisk søgning finder kilder, og en LLM genererer et svar baseret på kilderne.

Semantic search lukker kløften mellem mennesker og maskiner Mennesker tænker i koncepter og betydning. Traditionelle søgemaskiner tænker i nøgleord. Semantic search oversætter mellem de to verdener: den forstår hvad du mener og finder hvad du leder efter, uanset hvilke ord du bruger. Det er et fundamentalt skifte fra “du skal lære at søge som en maskine” til “maskinen lærer at forstå dig.” For virksomheder der bygger søgning i deres produkter er semantic search ikke længere en nice-to-have. Det er den forventede standard.


FAQ

Hvad er semantic search?

Semantic search er søgeteknologi der forstår betydningen af din søgning i stedet for kun at matche nøgleord. Den bruger embeddings (numeriske repræsentationer af tekst) til at finde dokumenter med lignende betydning, uanset om de bruger de samme ord som din søgning.

Hvad er forskellen på semantic search og Google-søgning?

Google bruger en kombination af nøgleordsmatchning, semantic search og mange andre signaler (links, popularitet, friskhed). Semantic search er én af teknologierne Google bruger. Du kan bygge semantic search i dine egne applikationer med embeddings og vector databases.

Hvordan implementerer man semantic search?

Du har brug for tre ting: en embedding-model (f.eks. OpenAI Embeddings eller en open source-model), en vector database (Pinecone, Qdrant, pgvector) og en pipeline der konverterer dine dokumenter og søgeforespørgsler til embeddings. Mange frameworks som LangChain og LlamaIndex gør dette nemt.

Er semantic search bedre end nøgleordssøgning?

For de fleste use cases er semantic search bedre til at forstå brugerens hensigt og finde relevante resultater. Men nøgleordssøgning er stadig bedre til præcise termer (produktnavne, koder, ID'er). Den bedste løsning er hybrid søgning der kombinerer begge metoder.


Relaterede termer