Spring til indhold
AI Ordbog

AI Ordbog

Interpretability

Graden af hvor let det er for mennesker at forstå en AI-models interne mekanismer og beslutningsprocesser.

Kristian Primdal Skrevet og redigeret af Kristian Primdal · Sidst opdateret 18. marts 2026

Indhold

Hvad er interpretability?

Interpretability (fortolkelighed) handler om i hvor høj grad mennesker kan forstå en AI-models interne mekanismer, ikke bare hvad den gør. Også hvordan og hvorfor den gør det. En model med høj interpretability er en model hvis beslutningsproces kan inspiceres, følges og forstås.

Tænk på forskellen mellem en lommeregner og et orakel. En lommeregner er fuldt fortolkelig: du kan følge hvert beregningstrin og verificere resultatet. Et orakel giver svar uden forklaring. Du kan kun vurdere om svaret virker rigtigt. De fleste moderne AI-systemer ligger et sted på dette spektrum.

Interpretability vs. explainability

Begreberne bruges ofte synonymt, men der er en vigtig nuance:

InterpretabilityExplainability
FokusModellens indre mekanismerForklaringer til brugeren
Spørgsmål“Hvordan fungerer modellen?”“Hvorfor gav modellen dette svar?”
TilgangForstå selve modellenGenerere forklaringer af output
EksempelAnalysere neuronernes aktiveringsmønstreSHAP-scores der viser feature importance
MålgruppePrimært forskere og udviklereBrugere, beslutningstagere, regulatorer

En model kan være forklarbar (explainable) uden at være fortolkelig (interpretable). SHAP kan generere en plausibel forklaring for et neuralt netværks beslutning, men det giver ikke reel indsigt i netværkets interne beregninger. Omvendt er en decision tree iboende fortolkelig. Du kan følge beslutningsstien direkte.

Spektret af interpretability

Fuldt fortolkelige modeller

Modeller hvor hele beslutningsprocessen kan inspiceres:

Lineær regression

Pris = 25.000 × areal + 50.000 × soveværelser + 100.000 × beliggenhed_score - 5.000 × alder

Hvert features bidrag er direkte aflæseligt. Du kan præcis se hvorfor en bolig vurderes til en bestemt pris.

Decision trees En beslutningssti fra rod til blad kan følges:

  1. Er indkomst > 400.000? → Ja
  2. Er gæld-til-indkomst < 40%? → Ja
  3. Er betalingshistorik ren? → Nej
  4. → Afvis lån

Regelbaserede systemer Eksplicitte if-then-regler der kan læses og verificeres af mennesker.

Delvist fortolkelige modeller

Generaliserede additive modeller (GAM) Viser hver features individuelle effekt som en kurve, men fanger ikke interaktioner mellem features.

Attention-baserede modeller Transformer-modeller producerer attention-vægte der viser hvilke dele af input modellen fokuserer på. Det giver delvis indsigt, men attention er ikke en fuldstændig forklaring af beslutningen.

Ufortolkelige modeller (black boxes)

Dybe neurale netværk med milliarder af parametre, ensemble-modeller der kombinerer hundredvis af undermodeller, og store sprogmodeller som GPT og Claude. Den interne beslutningsproces er for kompleks til direkte inspektion.

Mechanistic interpretability

Et aktivt forskningsfelt inden for interpretability handler om at forstå hvad der foregår inde i neurale netværk på et mekanistisk niveau: at reverse-engineere de algoritmer netværket har lært.

Hvad er mechanistic interpretability?

I stedet for at behandle et neuralt netværk som en black box forsøger mechanistic interpretability at:

  1. Identificere features. Hvad repræsenterer individuelle neuroner eller grupper af neuroner? En neuron kan repræsentere konceptet “kurvet linje”, “dansk sprog” eller “sarkasme”
  2. Kortlægge kredsløb. Hvordan flyder information gennem netværket? Hvilke neuroner samarbejder for at løse en opgave?
  3. Forstå algoritmer. Hvilke beregningsmæssige strategier har netværket lært? Bruger det intern “planlægning”? Har det lært at ræsonnere?

Centrale fund

Superposition. Forskere hos Anthropic har vist at neurale netværk kan repræsentere langt flere koncepter end de har neuroner, ved at overlappe repræsentationer. En enkelt neuron kan bidrage til at repræsentere mange forskellige features.

Induktionshoveder. I transformer-modeller er specifikke attention-hoveder blevet identificeret der implementerer “kopierings”-adfærd: de finder mønstre i teksten og forudsiger at mønstret gentages.

Features som retninger. Koncepter repræsenteres som retninger i et højdimensionelt rum snarere end som individuelle neuroner. “Sandhed” og “faktuelt” kan have en bestemt retning i modellens interne repræsentation.

Sparse autoencoders

En vigtig teknik i moderne interpretability-forskning. Sparse autoencoders trænes til at dekomponere neurale netværks aktivationer i forståelige features. Anthropic har brugt denne teknik til at identificere millioner af interpretable features i Claude, herunder features relateret til specifikke koncepter, sprog, følelser og abstrakte idéer.

Hvorfor er interpretability vigtigt?

AI safety

Interpretability er vigtigt for at verificere at AI-systemer er sikre. Hvis vi kan forstå hvad en model “tænker”, kan vi:

  • Opdage om modellen har lært uønskede mål
  • Verificere at sikkerhedsforanstaltninger virker
  • Forudsige modellens adfærd i nye situationer
  • Identificere potentielt farlige kapabiliteter

Debugging og forbedring

Forståelse af modellens interne mekanismer gør det muligt at rette fejl præcist i stedet for at prøve sig frem. Hvis du ved at en bestemt gruppe af neuroner er ansvarlig for en fejlagtig adfærd, kan du målrette din intervention.

Videnskabelig forståelse

Neurale netværk kan lære løsninger som mennesker ikke har fundet. Interpretability kan afsløre nye algoritmer og strategier der er nyttige ud over AI-feltet. Inden for matematik, biologi, fysik og andre videnskaber.

Regulering

EU AI Act kræver gennemsigtighed for højrisiko AI-systemer. Dybere interpretability gør det muligt at opfylde disse krav mere meningsfuldt end overfladiske post-hoc forklaringer.

Praktiske eksempler

Eksempel 1: Fortolkelig kreditmodel

En bank vælger bevidst en GAM-model fremfor et neuralt netværk til kreditvurdering:

  • Modellen viser tydeligt at betalingshistorik har størst indflydelse
  • Effekten af gæld-til-indkomst kan visualiseres som en kurve
  • Regulatorer kan inspicere modellen direkte og verificere at den ikke diskriminerer
  • Kunder kan få præcise forklaringer på afslag

Modellen er marginalt mindre præcis end et neuralt netværk, men fuldt gennemsigtig.

Eksempel 2: Mechanistic interpretability i praksis

Anthropic publicerede i 2024 en analyse af Claude der identificerede specifikke features via sparse autoencoders:

  • En feature der aktiverer ved omtale af San Francisco
  • En feature der aktiverer ved sarkastisk tone
  • En feature relateret til sikkerhedsrelaterede afvisninger
  • Features der repræsenterer abstrakte koncepter som “bedrag” eller “code-switching”

Denne viden kan bruges til at forstå og kontrollere modellens adfærd.

Eksempel 3: Afvejningen i sundhed

Et hospital skal vælge mellem:

  • Fortolkelig model (logistisk regression): 89% accuracy, fuld gennemsigtighed, læger kan validere logikken
  • Black box (deep learning): 94% accuracy, kræver post-hoc forklaringer, intern logik ukendt

Valget afhænger af konteksten. For screening hvor 89% er tilstrækkeligt, kan den fortolkelige model foretrækkes. For sjældne sygdomme hvor de ekstra 5% kan redde liv, kan den mere præcise model med supplerende forklarlighed være bedre.

Udfordringer

Fortolkelighed koster præcision

Der er ofte en afvejning: enklere, mere fortolkelige modeller er typisk mindre præcise end komplekse black boxes. For opgaver der kræver høj præcision, kan det være svært at retfærdiggøre en fortolkelig men mindre præcis model.

Skalering

Mechanistic interpretability er stadig tidskrævende og ressourcekrævende. At forstå en model med milliarder af parametre kræver betydelig forskningsindsats. Feltet arbejder på at automatisere og skalere disse metoder.

Fortolkninger kan vildlede

En fortolkning der virker intuitiv er ikke nødvendigvis korrekt. Attention-vægte ser f.eks. meningsfulde ud men er ikke altid kausalt forbundet med modellens beslutning. Forskere skal være forsigtige med at drage forhastede konklusioner.

Hvem kan forstå det?

Selv når en model er teknisk fortolkelig, kræver forståelsen ofte dyb teknisk ekspertise. En decision tree med 500 noder er teknisk fortolkelig men praktisk uforståelig for de fleste. Interpretability skal matches til målgruppens kompetenceniveau.

Ofte stillede spørgsmål

Hvad er interpretability i AI?

Interpretability er graden af hvor let det er for mennesker at forstå en AI-models interne mekanismer og beslutningsprocesser. En høj grad af interpretability betyder at man kan inspicere, følge og forstå hvordan modellen når frem til sine resultater, ikke bare hvad resultatet er. Også hvordan og hvorfor.

Hvad er forskellen på interpretability og explainability?

Interpretability fokuserer på at forstå modellens indre mekanismer: hvordan den fungerer. Explainability fokuserer på at generere forståelige forklaringer af modellens output til brugere. En model kan være forklarbar via SHAP-scores uden at være fortolkelig. En decision tree er iboende fortolkelig uden at kræve separate forklaringsværktøjer.

Hvad er mechanistic interpretability?

Mechanistic interpretability er et forskningsfelt der forsøger at reverse-engineere neurale netværk for at forstå hvilke algoritmer og repræsentationer de har lært. Det involverer at identificere hvad neuroner og grupper af neuroner repræsenterer, kortlægge informationsflow og forstå de beregningsmæssige strategier modellen bruger.

Skal man altid vælge en fortolkelig model?

Ikke nødvendigvis. Valget afhænger af konteksten. For højrisiko-beslutninger (sundhed, kredit, retshåndhævelse) er interpretability ofte afgørende. For lavrisiko-opgaver (anbefalinger, spamfiltrering) kan præcision prioriteres. I praksis kombinerer mange systemer en præcis black box med forklaringsværktøjer der giver tilstrækkelig gennemsigtighed.


Relaterede termer