AI Ordbog
Multimodal reasoning
En AI-models evne til at ræsonnere og drage konklusioner på tværs af flere datatyper (tekst, billeder, lyd og video) samtidigt.
Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026Indhold
Hvad er multimodal reasoning?
Multimodal reasoning er en AI-models evne til at ræsonnere (tænke logisk, drage konklusioner og løse problemer) på tværs af flere datatyper samtidigt. Det handler ikke bare om at modellen kan modtage billeder og tekst, men at den kan forstå sammenhængen mellem dem og bruge information fra den ene modalitet til at ræsonnere over den anden.
Forskellen er afgørende. En model der kan beskrive hvad der er på et billede har multimodal perception: den genkender indhold i forskellige modaliteter. En model med multimodal reasoning kan bruge billedet sammen med tekst til at løse et problem der kræver begge dele.
Multimodal perception: “Dette billede viser en graf med to linjer.”
Multimodal reasoning: “Grafen viser at virksomhed A’s omsætning oversteg virksomhed B’s i Q3 2024. Baseret på vækstraterne vil forskellen sandsynligvis vokse til ca. 15% i Q4, fordi virksomhed A’s linje stiger med ~8% per kvartal mens virksomhed B’s er flad.”
Det første er genkendelse. Det andet er ræsonnering: modellen aflæser data fra grafen, beregner vækstrater, og projicerer en fremtidig udvikling. Det kræver integration af visuel forståelse med matematisk og logisk ræsonnering.
Hvorfor er multimodal reasoning vigtigt?
Verden er multimodal
Mennesker ræsonnerer naturligt på tværs af modaliteter hele tiden. En læge ser et røntgenbillede, læser patientens journal og lytter til symptombeskrivelsen. Og integrerer alle tre informationskilder til en diagnose. En ingeniør kigger på en teknisk tegning, læser specifikationerne og undersøger den fysiske komponent for at finde fejlen. En analytiker ser en graf, læser rapporten og trækker på baggrundsviden for at vurdere situationen.
AI-modeller der kun forstår tekst kan ikke assistere med disse opgaver. Modeller der kan se billeder men ikke ræsonnere over dem i kontekst er begrænset til beskrivelser. Multimodal reasoning er forudsætningen for AI der kan hjælpe med opgaver som mennesker udfører i deres daglige arbejde.
Fra perception til forståelse
Udviklingen i AI’s multimodale kapabiliteter kan beskrives i tre stadier:
Stadie 1. Unimodal: Modeller der arbejder med én datatype. GPT-3 forstår tekst. ResNet klassificerer billeder. Whisper transskriberer lyd. Ingen forbindelse mellem modaliteterne.
Stadie 2. Multimodal perception: Modeller der kan modtage flere datatyper og beskrive dem. GPT-4V kan beskrive et billede. Gemini kan transskribere lyd og tekst. Men ræsonneringen er primært inden for hver modalitet.
Stadie 3. Multimodal reasoning: Modeller der ræsonnerer sammenhængende på tværs af modaliteter. De kan bruge information fra et billede til at besvare et tekstspørgsmål, kombinere grafdata med kontekstuel viden, eller løse problemer der kræver forståelse af sammenhængen mellem lyd, billede og tekst.
Vi er midt i overgangen fra stadie 2 til stadie 3. De nyeste modeller (GPT-4o, Claude, Gemini) viser stærke multimodal reasoning-kapabiliteter, men feltet er i hurtig udvikling.
Typer af multimodal reasoning
Visuel-tekstuel ræsonnering
Den mest udbredte form. Modellen kombinerer forståelse af billeder med tekstbaseret ræsonnering:
Grafanalyse: Aflæs data fra en graf, beregn tendenser, sammenlign med benchmarks, og formulér en konklusion.
Dokumentforståelse: Forstå et komplekst dokument med tekst, tabeller, diagrammer og billeder som en sammenhængende helhed. Ikke bare de individuelle elementer.
Matematisk ræsonnering fra billeder: Løs geometri-opgaver fra håndtegnede figurer, analysér statistiske plots, eller verificér beregninger præsenteret visuelt.
Spatial ræsonnering: Forstå rumlige relationer i billeder (hvad er foran, bagved, over, under) og ræsonnér over dem.
Lyd-tekstuel ræsonnering
Modellen kombinerer lydforståelse med tekstbaseret ræsonnering:
Samtaleanalyse: Analysér en optagelse af et møde og identificér beslutninger, handlingspunkter og uenigheder. Ikke bare transskribér hvad der blev sagt.
Musisk analyse: Forstå melodiske mønstre, harmonisk struktur og stemning i et musikstykke og sæt det i kontekst.
Diagnostik fra lyd: Identificér unormale lyde i maskineri, hjerteslag eller lungelyde og ræsonnér over mulige årsager.
Video-ræsonnering
Den mest komplekse form, fordi video kombinerer visuelle frames, lyd og tidsmæssig udvikling:
Hændelsesforståelse: Forstå hvad der sker i en videosekvens. Ikke bare hvad der er i hvert frame, men hvad der udvikler sig over tid.
Instruktionsforståelse: Se en instruktionsvideo og ekstrahere trinvise instruktioner, identificere fejl eller foreslå forbedringer.
Sportanalyse: Analysér spilsituationer, identificér taktikker og vurdér spillerpræstationer fra videooptagelser.
Praktiske eksempler
Eksempel 1: Medicinsk ræsonnering
Input: Et røntgenbillede af en brystkasse + tekst: “62-årig mand. Ryghistorik: 40 pakkeår. Tiltagende åndenød over 3 måneder. Vægttab på 8 kg.”
Multimodal reasoning: Modellen identificerer en skygge i højre lunges overlap, vurderer den i kontekst af patientens ryghistorik og symptomer, og konkluderer at det er højrisiko for malignitet. Den anbefaler CT-scanning og biopsi, og forklarer sit ræsonnement trin for trin.
Her integrerer modellen visuel information (røntgenbilledet) med tekstuel information (patienthistorik) og domæneviden (lungecancer-risikofaktorer) til en sammenhængende klinisk vurdering.
Eksempel 2: Finansiel analyse
Input: En graf over aktiekurser + en tabel med nøgletal + tekst: “Virksomheden annoncerede et opkøb til 2,3 mia. kr. den 15. marts.”
Multimodal reasoning: Modellen aflæser at aktiekursen faldt 12% den 15. marts (fra grafen), identificerer at P/E-ratioen steg fra 18 til 24 (fra tabellen), og vurderer at markedet reagerede negativt fordi opkøbsprisen (fra teksten) var over markedskonsensus. Den beregner at kursen skal stige 14% for at nå niveauet før annoncering og vurderer sandsynligheden baseret på historiske mønstre efter lignende opkøb.
Eksempel 3: Teknisk fejlfinding
Input: Et screenshot af en fejlmeddelelse + et diagram over systemarkitekturen + tekst: “Fejlen opstår efter deployment af version 3.2. Alle services kører normalt undtagen betalingsgateway.”
Multimodal reasoning: Modellen læser fejlmeddelelsen (fra screenshot), identificerer at den stammer fra en timeout mellem API gateway og betalingsservice (fra arkitekturdiagrammet), og ræsonnerer at version 3.2 sandsynligvis har ændret en konfiguration der påvirker forbindelsen. Den foreslår specifikke diagnostiske trin baseret på arkitekturen.
Eksempel 4: Undervisning og læring
Input: Et foto af en håndskrevet matematikopgave fra en elev.
Multimodal reasoning: Modellen læser elevens håndskrift, identificerer at udregningen er korrekt i trin 1-3 men at der er en fortegnsfejl i trin 4, og forklarer præcis hvor fejlen opstår og hvorfor. Den kan generere lignende opgaver til øvelse og foreslå en alternativ løsningsmetode.
Eksempel 5: Tilgængelighed
Input: Et foto af en restaurant-menu + tekst: “Jeg er glutenintolerant og allergisk over for nødder.”
Multimodal reasoning: Modellen læser menuen fra billedet, identificerer retter der sandsynligvis indeholder gluten eller nødder baseret på ingrediensbeskrivelserne, og anbefaler sikre valg. Den fremhæver retter der kan tilpasses og foreslår spørgsmål til tjeneren om specifikke ingredienser.
Multimodal reasoning vs. multimodal AI
| Multimodal AI | Multimodal reasoning | |
|---|---|---|
| Definition | Kan arbejde med flere datatyper | Kan ræsonnere på tværs af datatyper |
| Fokus | Input og output i flere modaliteter | Logisk integration af information |
| Eksempel | “Beskriv dette billede” | “Hvad kan vi konkludere fra denne graf i kontekst af rapporten?” |
| Kompleksitet | Perception og genkendelse | Analyse, syntese og slutning |
| Krav | Multimodal encoder/decoder | Multimodal encoder + stærk ræsonneringsevne |
Multimodal AI er paraplyen. Multimodal reasoning er den avancerede kapabilitet inden for multimodal AI der muliggør egentlig tænkning på tværs af modaliteter.
Modeller med multimodal reasoning
GPT-4o (OpenAI)
GPT-4o (“omni”) er designet fra bunden som en multimodal model. Den processerer tekst, billeder og lyd i en samlet arkitektur, hvilket giver stærk krydsmodal ræsonnering. Særligt stærk til visuel matematisk ræsonnering og dokumentanalyse.
Claude (Anthropic)
Claude’s vision-kapabiliteter kombineret med stærk ræsonneringsevne og extended thinking giver effektiv multimodal reasoning. Særligt stærk til analyse af komplekse dokumenter, tekniske diagrammer og data-visualiseringer.
Gemini (Google)
Gemini er bygget som en “natively multimodal” model og kan processere tekst, billeder, lyd og video i en samlet arkitektur. Understøtter ekstremt lange multimodale kontekster: timevis af video med tilhørende tekst.
Open source
Modeller som LLaVA, InternVL og Qwen-VL tilbyder multimodal reasoning i open source. De er typisk stærke på standardopgaver men kan mangle den dybe ræsonneringsevne af de største proprietære modeller.
Evaluering af multimodal reasoning
Benchmarks
Multimodal reasoning evalueres med specialiserede benchmarks:
MMMU (Massive Multi-discipline Multimodal Understanding): Tester modellens evne til at løse universitets-niveau opgaver der kræver forståelse af billeder og tekst. Fra kunst til naturvidenskab.
MathVista: Matematiske ræsonneringsopgaver præsenteret visuelt: grafer, geometriske figurer, tabeller.
ChartQA: Spørgsmål der kræver aflæsning og ræsonnering over grafer og diagrammer.
DocVQA: Spørgsmål til dokumenter der kræver forståelse af layout, tabeller og tekst i kombination.
Udfordringer ved evaluering
Multimodal reasoning er sværere at evaluere end unimodal ræsonnering, fordi:
- Opgaverne er mere komplekse og åbne
- Korrekthed kan afhænge af subjektiv vurdering
- Modellen kan nå det rigtige svar med forkert ræsonnement (eller omvendt)
- Benchmarks fanger ikke altid den reelle kvalitet af ræsonneringen
Begrænsninger
Hallucination forstærkes
Multimodal reasoning kan forstærke hallucination, fordi modellen nu kan hallucinere på tværs af modaliteter. Den kan “se” noget i et billede der ikke er der og bygge en logisk men faktuelt forkert ræsonnering ovenpå.
Visuel nøjagtighed
Modeller kan have svært ved præcis aflæsning af tal i grafer, små detaljer i billeder eller subtile forskelle. En models ræsonnering er kun så god som dens perception. Hvis den aflæser 42 i stedet for 47, vil hele den efterfølgende ræsonnering bygge på forkert data.
Kompleksitetsgrænser
For meget komplekse multimodale opgaver (som at analysere 50 sider med grafer, tabeller og tekst) kan modellens ræsonneringsevne degradere. Der er en praktisk grænse for hvor mange modaliteter og hvor meget information modellen kan integrere sammenhængende.
Bias på tværs af modaliteter
Modellen kan vise bias i hvordan den vægter information fra forskellige modaliteter. Nogle modeller vægter tekst højere end billeder, hvilket kan føre til at visuel information overses når den modsiger tekstuel information.
Fremtiden for multimodal reasoning
Flere modaliteter: Udvidelse til 3D-data, sensordata, taktil feedback og andre datatyper. Robotter der ræsonnerer over hvad de ser, hører og mærker.
Realtids multimodal reasoning: Modeller der kan ræsonnere over live video og lyd i realtid. Nødvendigt for AI-assistenter der hjælper i den fysiske verden.
Dybere ræsonnering: Kombination af multimodal reasoning med chain-of-thought og extended thinking for at løse stadig mere komplekse problemer der kræver mange ræsonneringstrin på tværs af modaliteter.
Specialiserede domæner: Multimodal reasoning finjusteret til specifikke domæner (medicinsk diagnostik, juridisk analyse, videnskabelig forskning) hvor krydsmodal forståelse er afgørende.
Ofte stillede spørgsmål
Hvad er multimodal reasoning?
Multimodal reasoning er en AI-models evne til at ræsonnere (tænke logisk, drage konklusioner og løse problemer) på tværs af flere datatyper som tekst, billeder, lyd og video samtidigt. Det går ud over simpel multimodal perception (genkendelse af indhold i forskellige modaliteter) til egentlig krydsmodal forståelse og logisk ræsonnering. For eksempel kan en model med multimodal reasoning aflæse data fra en graf, kombinere det med information fra en tekstrapport, og drage en begrundet konklusion.
Hvad er forskellen på multimodal AI og multimodal reasoning?
Multimodal AI er det brede begreb for AI-modeller der kan arbejde med flere datatyper: billeder, tekst, lyd, video. Multimodal reasoning er den avancerede kapabilitet inden for multimodal AI der handler om at ræsonnere og drage logiske konklusioner på tværs af disse datatyper. En model med multimodal AI kan beskrive et billede. En model med multimodal reasoning kan bruge billedet sammen med tekst til at løse et problem der kræver begge dele.
Hvilke AI-modeller har multimodal reasoning?
De mest avancerede multimodale modeller i 2025 inkluderer GPT-4o (OpenAI), Claude (Anthropic) og Gemini (Google). Alle tre kan modtage billeder og tekst og ræsonnere sammenhængende på tværs af modaliteterne. Gemini understøtter også video og lyd som input. I open source tilbyder modeller som LLaVA, InternVL og Qwen-VL multimodal reasoning, om end typisk på et lavere niveau end de største proprietære modeller.
Hvad bruges multimodal reasoning til i praksis?
Multimodal reasoning bruges til opgaver der kræver forståelse af flere informationstyper i kombination: analyse af dokumenter med grafer og tabeller, medicinsk diagnostik der kombinerer billeder og patientdata, teknisk fejlfinding baseret på screenshots og systemdiagrammer, finansiel analyse af rapporter med visuelle data, og undervisning hvor modellen forstår håndskrevne opgaver. Det er særligt værdifuldt i professionelle sammenhænge hvor beslutninger afhænger af information fra flere kilder og formater.