Spring til indhold
AI Ordbog

AI Ordbog

Embedding

En numerisk repræsentation af tekst, billeder eller andre data som et punkt i et matematisk rum.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er en embedding?

En embedding er en liste af tal, en vektor, der repræsenterer betydningen af noget. Det kan være en sætning, et dokument, et billede, en sang eller en brugers præferencer. Pointen er at omsætte noget menneskeligt (sprog, billeder) til noget matematisk (tal) som en computer kan arbejde med.

Det geniale ved embeddings er at lignende ting får lignende tal. Ordene “hund” og “kat” vil have embeddings der ligger tæt på hinanden i det matematiske rum, fordi de begge er kæledyr. “Hund” og “demokrati” vil ligge langt fra hinanden, fordi de ikke har noget til fælles.

Tænk på det som et koordinatsystem: hvert koncept får en placering. Koncepter med lignende betydning placeres tæt på hinanden. Embeddings er det der giver AI evnen til at forstå betydning, ikke bare genkende bogstaver og ord.

Hvorfor er embeddings vigtige?

  1. Computere forstår ikke tekst. En computer kan ikke direkte sammenligne “Jeg elsker kaffe” med “Jeg er vild med espresso.” Men den kan sammenligne deres embeddings og opdage at de betyder næsten det samme.
  2. Grundlag for næsten alt i AI. Embeddings er det første trin i stort set alle moderne AI-systemer. Sprogmodeller, billedgenkendelse, anbefalingssystemer og søgemaskiner bygger alle på embeddings.
  3. Semantisk søgning. Traditionel søgning matcher nøgleord. Embedding-baseret søgning matcher betydning. Du kan søge efter “hvordan laver man pasta” og finde et dokument der handler om “opskrift på hjemmelavet spaghetti”, selvom ordene er forskellige.
  4. Effektivitet. At sammenligne to embeddings (lister af tal) er ekstremt hurtigt. Det gør det muligt at søge i millioner af dokumenter på millisekunder.

Sådan fungerer embeddings

Fra tekst til tal

  1. Input. Du sender en tekst til en embedding-model (f.eks. OpenAIs text-embedding-3-small eller Coheres Embed).
  2. Processing. Modellen læser teksten og beregner en vektor, en liste af tal der repræsenterer tekstens betydning.
  3. Output. Du modtager en vektor med f.eks. 1.536 tal (dimensioner). Hvert tal repræsenterer et aspekt af tekstens betydning.

For eksempel kan embeddings for tre sætninger se sådan ud (forsimplet til 3 dimensioner):

  • “Hunden løber i parken” → [0.82, 0.15, 0.43]
  • “Katten leger i haven” → [0.79, 0.18, 0.41]
  • “Aktiemarkedet faldt i går” → [0.12, 0.87, 0.03]

De to første vektorer er tæt på hinanden (begge handler om dyr udendørs). Den tredje er langt væk (helt andet emne).

Dimensioner

Moderne embedding-modeller producerer vektorer med hundredvis til tusindvis af dimensioner:

  1. OpenAI text-embedding-3-small. 1.536 dimensioner.
  2. OpenAI text-embedding-3-large. 3.072 dimensioner.
  3. Cohere Embed v3. 1.024 dimensioner.
  4. Sentence-BERT. 384-768 dimensioner.

Flere dimensioner giver typisk mere nuancerede repræsentationer men kræver mere lagerplads og beregning.

Typer af embeddings

Tekst-embeddings

Den mest almindelige type. Konverterer tekst (ord, sætninger, dokumenter) til vektorer.

  1. Ord-embeddings. Tidlige metoder (Word2Vec, GloVe) der gav hvert ord én fast vektor. Problemet: “bank” fik samme vektor uanset om det betød finansinstitution eller flodbred.
  2. Kontekstuelle embeddings. Moderne metoder (BERT, GPT) der giver ord forskellige embeddings afhængigt af konteksten. “Bank” i “jeg gik i banken” og “fisken svømmede mod banken” får forskellige vektorer.
  3. Sætnings-embeddings. Hele sætninger eller afsnit konverteres til én vektor der fanger den samlede betydning.

Billed-embeddings

Billeder konverteres til vektorer:

  1. CLIP (OpenAI). Skaber embeddings for både tekst og billeder i det samme rum. Du kan finde billeder ved at søge med tekst, og omvendt.
  2. Brug. Billedsøgning, klassifikation, duplikat-detektion, multimodal søgning.

Multimodale embeddings

Embeddings der blander forskellige datatyper i samme rum:

  1. Tekst + billede. CLIP og lignende modeller placerer tekst og billeder i det samme vektorrum. En embedding for teksten “solnedgang over havet” ligger tæt på embeddings for billeder af solnedgange.
  2. Tekst + lyd. Embeddings der forbinder tekst og lyd for tale-søgning og musik-anbefalinger.

Hvad bruges embeddings til?

1. Semantisk søgning

Traditionel søgning matcher nøgleord. Embedding-baseret søgning matcher betydning:

  1. Alle dokumenter konverteres til embeddings og gemmes i en vector database.
  2. Brugerens søgning konverteres til en embedding.
  3. De dokumenter med embeddings tættest på søge-embeddingens placering returneres.
  4. Resultat: søgning der forstår at “billige flyrejser til Spanien” og “budget-flybilletter til Barcelona” handler om det samme.

2. RAG (Retrieval-Augmented Generation)

Embeddings er fundamentet for RAG, den mest populære teknik til at give sprogmodeller adgang til ekstern viden:

  1. Virksomhedens dokumenter konverteres til embeddings og gemmes.
  2. Når en bruger stiller et spørgsmål, konverteres spørgsmålet til en embedding.
  3. De mest relevante dokumenter findes via embedding-sammenligning.
  4. Dokumenterne sendes med som kontekst til sprogmodellen.
  5. Modellen svarer baseret på de relevante dokumenter, med aktuel, specifik information.

3. Anbefalingssystemer

  1. Produkter, film, sange og artikler konverteres til embeddings.
  2. Brugerens præferencer repræsenteres som en embedding baseret på hvad de har interageret med.
  3. Nye anbefalinger findes ved at søge efter embeddings tæt på brugerens præference-embedding.
  4. Netflix, Spotify og Amazon bruger alle embedding-baserede anbefalinger.

4. Klassifikation

  1. Dokumenter (emails, kundehenvendelser, artikler) konverteres til embeddings.
  2. En simpel classifier (f.eks. logistisk regression) trænes på embeddings til at kategorisere i klasser (spam/ikke-spam, positiv/negativ, kategori A/B/C).
  3. Embeddings gør klassifikation effektiv fordi den semantiske tunge løftning allerede er gjort af embedding-modellen.

5. Duplikat-detektion

  1. Beregn embeddings for alle dokumenter.
  2. Find par med ekstremt høj lighed (cosine similarity > 0.95).
  3. Disse er sandsynlige duplikater, selvom ordlyden er forskellig.
  4. Bruges til at rydde op i databaser, finde plagiater og fjerne gentagelser.

6. Clustering

  1. Beregn embeddings for en stor mængde tekster.
  2. Brug clustering-algoritmer (k-means, HDBSCAN) til at finde naturlige grupper.
  3. Eksempel: 50.000 kundehenvendelser grupperes automatisk i temaer (leveringsproblemer, returneringer, produktspørgsmål) uden at du manuelt definerer kategorierne.

Embedding-modeller

Kommercielle

  1. OpenAI Embeddings. text-embedding-3-small (billig, hurtig) og text-embedding-3-large (mere kapabel). De mest brugte embedding-API’er.
  2. Cohere Embed. Stærk til søgning og multilingual tekst. Understøtter 100+ sprog.
  3. Google Vertex AI Embeddings. Integreret i Google Cloud-platformen.
  4. Voyage AI (MongoDB). Specialiseret i høj-kvalitets embeddings for kode og tekst. Opkøbt af MongoDB i 2025.

Open source

  1. Sentence-BERT / all-MiniLM. Populære open source sætnings-embeddings. Kører lokalt.
  2. E5. Microsofts open source embedding-model med stærk kvalitet.
  3. BGE. Embedding-model fra Beijing Academy of AI med stærk multilingual kvalitet.
  4. Nomic Embed. Open source med lang kontekstlængde (8.192 tokens).

Embeddings og vector databases

Embeddings gemmes typisk i specialiserede vector databases:

  1. Pinecone. Managed vector database. Nemt at starte, betaling per forbrug.
  2. Weaviate. Open source vector database med kraftig hybrid søgning.
  3. Qdrant. Open source, høj ydeevne, populær til produktionsbrug.
  4. Chroma. Letvægts vector database populær til prototyping og mindre projekter.
  5. pgvector. PostgreSQL-extension der tilføjer vektorsøgning til en eksisterende PostgreSQL-database.

Disse databaser er optimeret til at søge hurtigt i millioner eller milliarder af embeddings, noget en normal database ikke kan gøre effektivt.

Afstand og lighed

For at afgøre om to embeddings er “tæt på hinanden” bruges afstandsmål:

  1. Cosine similarity. Måler vinklen mellem to vektorer. Værdi fra -1 (modsatte) til 1 (identiske). Det mest brugte mål for tekst-embeddings.
  2. Euklidisk afstand. Måler den “lige linje”-afstand mellem to punkter. Bruges i nogle use cases men mindre populær til tekst.
  3. Dot product. Simpel og hurtig. Bruges ofte internt i AI-modeller.

Embeddings i praksis

  1. Kundesupport. En virksomhed konverterer alle sine FAQ-artikler til embeddings. Når en kunde stiller et spørgsmål, matches det mod FAQ-embeddings og det mest relevante svar returneres, uden at kunden skal bruge præcis de rigtige nøgleord.
  2. Juridisk søgning. Et advokatfirma konverterer tusindvis af afgørelser og lovtekster til embeddings. Jurister kan søge efter “erstatning for forsinket levering” og finde relevante afgørelser selvom de bruger helt anderledes juridisk terminologi.
  3. E-commerce. En webshop konverterer produktbeskrivelser til embeddings. Kunder der søger “komfortabel kontorstol til dårlig ryg” finder ergonomiske stole selvom produktbeskrivelsen ikke nævner “dårlig ryg.”
  4. Intern videndeling. En virksomhed konverterer interne dokumenter, mails og Slack-beskeder til embeddings. Medarbejdere kan søge semantisk i al virksomhedens viden.

Embeddings er AI’s sprog for betydning Mennesker forstår betydning intuitivt. Vi ved at “glad” og “lykkelig” betyder næsten det samme. Computere kan ikke det. Embeddings er den bro der oversætter menneskelig betydning til tal som computere kan arbejde med. Det er den teknologi der gør det muligt for AI at “forstå”, ikke bare matche bogstaver men fange hvad noget betyder. Uden embeddings ville AI være begrænset til rigid nøgleordsmatchning. Med embeddings kan AI bevæge sig frit i betydningens rum.


FAQ

Hvad er en embedding i AI?

En embedding er en liste af tal (en vektor) der repræsenterer betydningen af tekst, billeder eller andre data i et matematisk rum. Lignende koncepter får lignende tal, hvilket gør det muligt for computere at arbejde med betydning, f.eks. at forstå at "hund" og "kat" er relaterede koncepter.

Hvad bruges embeddings til?

Embeddings bruges til semantisk søgning (finde dokumenter baseret på betydning, ikke nøgleord), RAG (give sprogmodeller adgang til ekstern viden), anbefalingssystemer, klassifikation, duplikat-detektion og clustering. De er fundamentale for næsten alle moderne AI-applikationer.

Hvad er forskellen på en embedding og en token?

En token er en tekstenhed (et ord eller en ordel) som sprogmodeller processerer. En embedding er den numeriske repræsentation af en teksts betydning. Tokens er input til modellen; embeddings er hvad modellen producerer internt for at forstå tekstens mening.

Hvordan kommer man i gang med embeddings?

Den nemmeste vej er at bruge et API som OpenAIs Embeddings (`text-embedding-3-small`) eller Coheres Embed. Send tekst, modtag en vektor. Gem vektorerne i en vector database (Pinecone, Chroma, pgvector) og søg via cosine similarity. Der findes også gratis open source-modeller du kan køre lokalt.


Relaterede termer