AI Ordbog
Large Multimodal Model (LMM)
Store AI-modeller der kan forstå og generere indhold på tværs af tekst, billeder, lyd og video.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 22. marts 2026Indhold
Hvad er en Large Multimodal Model (LMM)?
En Large Multimodal Model (forkortet LMM) er en stor AI-model der kan forstå og generere indhold på tværs af flere datatyper: tekst, billeder, lyd og video. Begrebet er den multimodale pendant til Large Language Model (LLM). Hvor en LLM udelukkende arbejder med tekst, kan en LMM kombinere flere modaliteter i én samlet model.
Når du uploader et billede til ChatGPT og stiller et spørgsmål om det, sender en stemmebesked til Claude eller beder Gemini analysere en video, bruger du en LMM. Modellen modtager flere typer input, forstår sammenhængen mellem dem og producerer et meningsfuldt svar.
De fleste frontier-modeller i dag er teknisk set LMM’er. GPT-4o, Gemini og Claude kan alle behandle både tekst og billeder. Alligevel bruger mange stadig betegnelsen “LLM” om dem. Det skyldes at LLM blev det dominerende begreb før modellerne blev multimodale, og vanen har hængt ved.
LMM vs. LLM: den afgørende forskel
Forskellen mellem en LLM og en LMM handler fundamentalt om hvad modellen kan arbejde med:
| LLM | LMM | |
|---|---|---|
| Input | Kun tekst | Tekst, billeder, lyd, video |
| Output | Kun tekst | Tekst og i visse modeller billeder, lyd, video |
| Arkitektur | Transformer optimeret til tekst | Transformer + modalitetsspecifikke encodere + fusionsmekanisme |
| Træningsdata | Tekst (bøger, web, kode) | Tekst + billede-tekst-par + lyd + video |
| Eksempler | GPT-3, tidlige Llama-modeller | GPT-4o, Gemini, Claude |
En nyttig analogi: en LLM er som en person der kun kan læse og skrive. En LMM er som en person der også kan se billeder, høre lyd og forstå video. Den første kan besvare tekstbaserede spørgsmål. Den anden kan se på et dokument med grafer og tabeller og fortælle dig hvad tallene betyder.
Grænsen mellem LLM og LMM er dog flydende. De fleste moderne “LLM’er” har fået multimodale kapabiliteter tilføjet, så betegnelsen LLM bruges ofte løst om modeller der teknisk set er LMM’er.
Hvordan er en LMM bygget?
En LMM består typisk af tre kernekomponenter:
Modalitetsspecifikke encodere. Separate neurale netværk der forstår hver datatype. En vision encoder (f.eks. ViT) behandler billeder. En audio encoder behandler lyd. En tekst-tokenizer håndterer tekst. Hver encoder oversætter sin datatype til en numerisk repræsentation modellen kan arbejde med.
Fusionsmekanisme. Den komponent der binder modaliteterne sammen. Her projekteres de forskellige repræsentationer ind i ét fælles rum, så modellen kan forstå sammenhængen mellem et billede og den tekst der ledsager det. Det sker typisk via kryds-attention eller lærte projektionslag.
Sprogmodel-backbone. Kernen er stadig en transformer-baseret sprogmodel der udfører ræsonneringen. De andre modaliteter projekteres ind i sprogmodellens token-rum, så modellen kan “tænke” over billeder og lyd på samme måde som den tænker over tekst.
Nativt multimodal vs. bolt-on
Der er to veje til at bygge en LMM:
Nativt multimodal: Modellen er trænet fra bunden på alle modaliteter samtidig. GPT-4o og Gemini er bygget på denne måde. Fordelen er dybere forståelse på tværs af modaliteter, fordi modellen har lært sammenhængene fra starten.
Bolt-on (sammensat): En eksisterende LLM udvides med separate encodere via adaptere. Modeller som LLaVA og MiniGPT-4 bruger denne tilgang. Det er hurtigere at bygge, men den krydsmodale forståelse kan være svagere fordi delene ikke er trænet sammen.
Tendensen går mod nativt multimodale modeller, fordi de giver bedre resultater på opgaver der kræver dyb forståelse af sammenhængen mellem datatyper.
Hvilke LMM’er findes der?
Proprietære
GPT-4o og GPT-5-serien (OpenAI). Nativt multimodal. Behandler tekst, billeder, lyd og video i én arkitektur. Kan generere billeder direkte. Real-time stemmesamtaler. En af de mest alsidige LMM’er.
Gemini (Google). Nativt multimodal fra bunden. Særligt stærk på video og lange multimodale kontekster med op til 1 million tokens. Integreret i Google-produkter.
Claude (Anthropic). Stærk på tekst og billeder. Særligt god til at analysere diagrammer, grafer, tekniske tegninger og lange dokumenter. Kendt for pålidelighed og sikkerhed.
Open source
Llama 4 (Meta). Metas nyeste generation bruger Mixture of Experts (MoE) og er multimodal. Llama 4 Maverick er konkurrencedygtig med mange proprietære modeller.
Qwen3-VL (Alibaba). Vision-language model med stærk flersproglig understøttelse og avanceret billedforståelse. Efterfølgeren til Qwen2.5-VL.
Janus-Pro (DeepSeek). Open source-model der både kan forstå og generere billeder og tekst.
LMM’er i praksis for danske virksomheder
LMM’er åbner for opgaver der ikke er mulige med rene tekstmodeller:
Dokumentanalyse. Upload en faktura, en kontrakt eller en rapport med tabeller og grafer. LMM’en læser teksten, aflæser graferne og opsummerer det hele. Du behøver ikke manuelt at konvertere noget til tekst først.
E-commerce produktbeskrivelser. Tag fotos af dine produkter og lad modellen generere beskrivelser, kategorisere produkter eller foreslå metadata baseret på billederne.
Kundesupport med billeder. Kunder sender et foto af et defekt produkt eller en fejlmeddelelse. LMM’en analyserer billedet og foreslår en løsning. Uden at kunden skal beskrive problemet i tekst.
Teknisk fejlfinding. Upload et screenshot af en fejl, et diagram over systemarkitekturen eller et foto af en defekt komponent. Modellen kombinerer det visuelle med din tekstbeskrivelse og hjælper med diagnosen.
Mødereferater fra optagelser. Send en video- eller lydoptagelse af et møde. LMM’en transskriberer, opsummerer og finder beslutninger og handlingspunkter.
Terminologisk forvirring: LMM, MLLM og VLM
Terminologien for multimodale modeller er ikke standardiseret. Du vil støde på flere forkortelser:
- LMM (Large Multimodal Model): det bredeste begreb for store multimodale modeller
- MLLM (Multimodal Large Language Model): understreger at kernen er en sprogmodel med multimodale udvidelser
- VLM (Vision-Language Model): bruges specifikt om modeller der kombinerer billeder og tekst
I praksis bruges termerne ofte synonymt. LMM er den mest præcise betegnelse for modeller der håndterer flere modaliteter. VLM bruges når fokus er specifikt på billedforståelse kombineret med tekst. MLLM er den mest teknisk præcise, fordi de fleste multimodale modeller stadig har en sprogmodel som kerne.
Hvorfor siger alle stadig “LLM”? Fordi LLM blev det dominerende begreb i 2022-2023 da ChatGPT slog igennem. På det tidspunkt var modellerne primært tekstbaserede. Selv efter at GPT-4, Claude og Gemini blev multimodale, fortsatte mange med at sige “LLM”. Det er teknisk upræcist, men det er blevet konvention. Tænk på det som at kalde en smartphone en “telefon”, selvom den gør langt mere end at ringe.
Fra LLM til LMM: en naturlig evolution
Udviklingen fra LLM til LMM følger en logisk bue:
Fase 1: Tekst (LLM). GPT-3, tidlige Claude og Llama-modeller. Kun tekst ind, tekst ud. Ekstremt kapable inden for sprog, men blinde for alt andet.
Fase 2: Tekst + billeder (tidlig LMM). GPT-4 med billedforståelse, Claude med vision. Modellerne kunne modtage billeder som input, men var stadig primært tekstmodeller med billedforståelse boltet på.
Fase 3: Nativt multimodal (moderne LMM). GPT-4o, Gemini. Modeller der er trænet fra bunden på alle modaliteter. De forstår ikke bare tekst og billeder separat, de forstår sammenhængen mellem dem. De kan generere billeder, tale og video. Ikke kun analysere det.
Denne evolution er ikke færdig. Næste skridt inkluderer modeller der kan interagere med den fysiske verden via robotter (computer use), forstå 3D-rum og sensordata, og operere i realtid over live video og lyd.
Begrænsninger
- Ulige styrker. De fleste LMM’er er stadig stærkest på tekst. Billedforståelse er god, men lyd- og videoforståelse varierer. Billedgenerering er forbedret markant, men er ikke perfekt.
- Højere beregningskrav. Multimodale modeller kræver mere beregningskraft end rene tekstmodeller. Flere encodere og krydsmodal attention gør dem dyrere at træne og køre.
- Hallucination på tværs af modaliteter. En LMM kan “se” noget i et billede der ikke er der og bygge en overbevisende men forkert analyse ovenpå. Krydsmodal hallucination er sværere at opdage end ren teksthallucination.
- Privatlivshensyn. Modeller der kan analysere billeder og video rejser nye spørgsmål om privatliv. Et uploadet billede kan indeholde ansigter, fortrolige dokumenter eller andre følsomme data.
FAQ
Hvad er en LMM?
En Large Multimodal Model (LMM) er en stor AI-model der kan forstå og generere indhold på tværs af flere datatyper: tekst, billeder, lyd og video. Hvor en LLM kun arbejder med tekst, kan en LMM kombinere flere modaliteter i én model. GPT-4o, Gemini og Claude er alle eksempler på LMM'er.
Hvad er forskellen på LLM og LMM?
En LLM (Large Language Model) arbejder primært med tekst. En LMM (Large Multimodal Model) kan arbejde med flere datatyper: tekst, billeder, lyd og video. De fleste frontier-modeller i dag er teknisk set LMM'er, selvom mange stadig kalder dem LLM'er. Forskellen handler om input og output: en LMM kan modtage et billede og besvare spørgsmål om det, mens en ren LLM kun kan arbejde med tekst.
Er GPT-4o en LLM eller en LMM?
GPT-4o er teknisk set en LMM, ikke en ren LLM. Den kan behandle tekst, billeder, lyd og video i én samlet model. Men fordi mange kender begrebet LLM bedre, omtales GPT-4o og lignende modeller ofte stadig som LLM'er. Det samme gælder Gemini og Claude.
Hvad bruges LMM'er til?
LMM'er bruges til opgaver der kræver forståelse af flere datatyper: dokumentanalyse med billeder og tabeller, kundesupport via billeder, produktbeskrivelser fra fotos, mødereferater fra video, medicinsk billedanalyse og teknisk fejlfinding fra screenshots. Enhver opgave hvor tekst alene ikke er nok.