Spring til indhold
AI Ordbog

AI Ordbog

Endpoint

En specifik URL hvor en AI-model kan kontaktes og bruges via et API.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 3. oktober 2026

Indhold

Hvad er et endpoint?

Et endpoint er en adresse, en URL, hvor en AI-model sidder klar til at modtage forespørgsler. Det er døren ind til modellen. Du banker på døren (sender en HTTP-forespørgsel), og modellen svarer (returnerer et svar).

Når du bruger ChatGPT via OpenAIs API, sender du din besked til endpointet https://api.openai.com/v1/chat/completions. Når du bruger Claude via Anthropics API, sender du til https://api.anthropic.com/v1/messages. Disse URL’er er endpoints. De specifikke steder hvor modellerne lytter efter forespørgsler.

Et endpoint er altså kombinationen af en URL og den funktionalitet der er tilgængelig på den URL. Det er kontaktpunktet mellem din applikation og AI-modellen.

Hvordan fungerer et endpoint?

Et typisk AI-endpoint følger dette flow:

  1. Forespørgsel. Din applikation sender en HTTP POST-forespørgsel til endpointets URL med din prompt, modelvalg og parametre.
  2. Autentificering. Endpointet verificerer din API-nøgle for at sikre at du har adgang.
  3. Validering. Input valideres: er formatet korrekt? Er parametrene gyldige? Er der tokens nok på kontoen?
  4. Routing. Forespørgslen sendes til den rette model og GPU-server baseret på modelvalg og belastning.
  5. Inference. Modellen processerer dit input og genererer output.
  6. Respons. Resultatet returneres som et struktureret svar (typisk JSON) til din applikation.

Typer af AI-endpoints

Chat completion endpoints

Det mest almindelige endpoint-format for sprogmodeller:

  1. Input. En liste af beskeder med roller (system, user, assistant) og indhold.
  2. Output. Modellens svar som en assistant-besked.
  3. Eksempler. OpenAI /v1/chat/completions, Anthropic /v1/messages, Google Gemini API.
  4. Bruges til. Chatbots, assistenter, tekstgenerering, analyse og alle konversationelle AI-applikationer.

Text completion endpoints

Det ældre format hvor modellen fortsætter en tekst:

  1. Input. En tekststreng som modellen skal fortsætte.
  2. Output. Den genererede fortsættelse.
  3. Eksempler. OpenAI /v1/completions (deprecated til fordel for chat format).
  4. Bruges til. Simpel tekstgenerering, legacy-applikationer.

Embedding endpoints

Konverterer tekst til numeriske vektorer:

  1. Input. En tekst eller liste af tekster.
  2. Output. Embedding-vektorer, lister af tal der repræsenterer tekstens betydning.
  3. Eksempler. OpenAI /v1/embeddings, Cohere Embed API.
  4. Bruges til. Semantisk søgning, dokumentsøgning, anbefalingssystemer, RAG-pipelines.

Image generation endpoints

Genererer billeder fra tekstbeskrivelser:

  1. Input. En tekstprompt der beskriver det ønskede billede.
  2. Output. Et eller flere genererede billeder (URL eller base64).
  3. Eksempler. OpenAI /v1/images/generations (DALL-E), Stability AI API.
  4. Bruges til. Billedgenerering, design, marketing-materiale.

Audio endpoints

Håndterer tale og lyd:

  1. Speech-to-text. Upload en lydfil, modtag transskription. OpenAI /v1/audio/transcriptions (Whisper).
  2. Text-to-speech. Send tekst, modtag en lydfil. OpenAI /v1/audio/speech.
  3. Bruges til. Transskription, stemmeassistenter, tilgængelighed, podcasts.

Custom model endpoints

Endpoints til dine egne fine-tunede modeller:

  1. Self-hosted. Du deployer din model via vLLM, TGI eller Triton og opretter dit eget endpoint.
  2. Managed. Cloud-udbydere (AWS SageMaker, Google Vertex AI, Azure ML) opretter endpoints for dine custom modeller.
  3. Bruges til. Proprietære modeller, specialiserede use cases, databeskyttelse.

Anatomy af et API-kald

Et typisk kald til et AI-endpoint:

Forespørgsel (request)

Indeholder:

  1. URL. Endpointets adresse (https://api.anthropic.com/v1/messages).
  2. HTTP-metode. Næsten altid POST for AI-endpoints.
  3. Headers. Autentificering (API-nøgle), content type (JSON), modelversion.
  4. Body. JSON med model, beskeder, parametre (temperature, max tokens, etc.).

Svar (response)

Returnerer:

  1. Status code. 200 (succes), 400 (ugyldig forespørgsel), 401 (manglende autentificering), 429 (rate limit), 500 (serverfejl).
  2. Body. JSON med modellens svar, metadata (tokens brugt, model-id, stop reason).
  3. Headers. Rate limit-information, request-id til debugging.

Streaming endpoints

Moderne AI-endpoints understøtter streaming: at modtage svaret token for token i stedet for at vente på hele svaret:

  1. Server-Sent Events (SSE). Den mest almindelige streaming-metode. Serveren sender data-events løbende over en vedvarende HTTP-forbindelse.
  2. Brugeroplevelse. Teksten dukker op ord for ord som i ChatGPT. Brugeren ser fremskridt i stedet for at vente.
  3. Time to First Token. Streaming reducerer den oplevede ventetid drastisk. Brugeren ser det første token inden for sekunder i stedet for at vente på hele svaret.
  4. Implementation. De fleste API’er aktiverer streaming med en simpel parameter (stream: true).

Endpoints i praksis

Integration i en webapplikation

  1. Din frontend sender brugerens besked til din backend.
  2. Din backend sender beskeden videre til AI-endpointet (f.eks. Anthropic API) med din API-nøgle.
  3. AI-endpointet returnerer modellens svar til din backend.
  4. Din backend sender svaret til frontenden.
  5. API-nøglen er aldrig eksponeret i frontenden. Den lever sikkert på din server.

Batch processing via endpoints

  1. Du har 10.000 produktbeskrivelser der skal genereres.
  2. Du sender forespørgslerne til et batch-endpoint (f.eks. Anthropics Message Batches API).
  3. Endpointet processerer alle forespørgsler og returnerer resultaterne samlet inden for 24 timer.
  4. 50% billigere end at sende dem individuelt til det normale endpoint.

Self-hosted endpoints

  1. Du deployer en open source-model (Llama 70B) via vLLM på din egen server.
  2. vLLM opretter et endpoint på din server (f.eks. http://din-server:8000/v1/chat/completions).
  3. Endpointet er kompatibelt med OpenAIs API-format. Du kan bruge samme kode som med OpenAIs API.
  4. Data forlader aldrig din infrastruktur.

Rate limits og throttling

AI-endpoints har begrænsninger for at beskytte infrastrukturen:

  1. Requests per minute (RPM). Maksimalt antal forespørgsler du kan sende per minut. Typisk 60-10.000 afhængigt af abonnement.
  2. Tokens per minute (TPM). Maksimalt antal tokens du kan processere per minut. Typisk 40.000-1.000.000.
  3. Tokens per day (TPD). Daglig grænse for total forbrug.
  4. Concurrent requests. Antal samtidige forespørgsler der kan være aktive.
  5. Retry-strategi. Når du rammer en rate limit (HTTP 429), bør du vente og prøve igen med eksponentiel backoff.

Endpoint-sikkerhed

  1. API-nøgler. Aldrig eksponér din API-nøgle i frontend-kode. Kald altid AI-endpoints fra din backend.
  2. HTTPS. Alle AI-endpoints bruger HTTPS for krypteret kommunikation.
  3. IP-whitelisting. Begræns adgang til endpointet til specifikke IP-adresser.
  4. Input-validering. Valider brugerinput før det sendes til endpointet for at forhindre prompt injection og misbrug.
  5. Logging og audit. Log alle kald til endpointet for at overvåge forbrug og opdage misbrug.

Endpoint-monitoring

Vigtige metrics at overvåge for AI-endpoints:

  1. Oppetid. Er endpointet tilgængeligt? Mål med health checks og uptime monitoring.
  2. Latency. Svartid for endpointet. Overvåg P50, P95 og P99 latency.
  3. Fejlrate. Procent af forespørgsler der returnerer fejl (4xx og 5xx status codes).
  4. Forbrug. Antal tokens og forespørgsler brugt. Vigtigt for budgettering og kapacitetsplanlægning.

Endpoints er AI’s kontaktflade med verden En AI-model uden et endpoint er som en telefon uden nummer. Den eksisterer, men ingen kan kontakte den. Endpoints er det der gør AI tilgængelig: de oversætter mellem den menneskelige verden (HTTP-forespørgsler, JSON, URL’er) og modellens verden (tensorer, tokens, beregninger). Kvaliteten af et endpoint (dets hastighed, pålidelighed, sikkerhed og brugervenlighed) afgør i høj grad kvaliteten af den samlede AI-oplevelse.


FAQ

Hvad er et endpoint i AI?

Et endpoint er en specifik URL-adresse hvor en AI-model er tilgængelig for forespørgsler via et API. Du sender din prompt til endpointet, modellen processerer den, og svaret returneres. For eksempel er `https://api.openai.com/v1/chat/completions` OpenAIs endpoint for GPT-modeller.

Hvad er forskellen på et API og et endpoint?

Et API (Application Programming Interface) er den samlede grænseflade for en tjeneste: alle regler, formater og muligheder. Et endpoint er én specifik URL inden for det API. Et API kan have mange endpoints: ét til chat, ét til billeder, ét til embeddings osv.

Har jeg brug for et endpoint for at bruge AI?

Hvis du bruger en AI-model programmatisk (i din app, dit system), ja. Du sender forespørgsler til et endpoint. Bruger du ChatGPT eller Claude via deres webside, bruger du også endpoints, men det sker automatisk bag kulisserne.

Hvad koster det at bruge et AI-endpoint?

De fleste AI-endpoints fakturerer per token (input + output). Priser varierer fra under $1 til $60+ per million tokens afhængigt af model og udbyder. Mange tilbyder gratis tiers med begrænsninger.


Relaterede termer