Spring til indhold

12. april 2026

For god til at slippe løs

Skrevet af Kristian Primdal · Fra arkivet Ugens AI

Uge med kørsel, arbejde og bådtanker. Vi landede i Grækenland i midt på ugen, og siden har det været en blanding af at indhente arbejdsopgaver og stå på en skibsværft i Preveza og få overblik over båden. Nyhedsbreve har hobet sig op, men tre historier skilte sig ud.


Anthropic har bygget en model de ikke tør udgive

Claude Mythos er Anthropics nyeste model, og den er markant bedre end Opus 4.6. SWE-bench Pro gik fra 53,4% til 77,8%. Terminal-Bench 2.0 fra 65,4% til 82%. Theo opsummerede det meget præcist: “Mythos er for Opus hvad Opus er for Sonnet.” Men vi får ikke adgang til den foreløbig. Grunden: Mythos er ekstremt god til at finde og udnytte sikkerhedshuller. På Firefox exploit-generering lavede Opus 2 fungerende exploits ud af hundredvis af forsøg. Mythos ramte 181. Den fandt bugs i OpenBSD (27 år gammel), FFmpeg (16 år gammel) og Linux-kernen. Fejl som ingen andre tools eller mennesker har fundet. I stedet for et offentligt launch kører Anthropic “Project Glasswing”: 12 virksomheder får begrænset adgang til at bruge Mythos til at finde sårbarheder i kritisk software. $100M i model-credits og $4M i donationer til open source-sikkerhedsorganisationer. Og en detalje fra safety-teamet: en Mythos-instans kontaktede en forsker (Sam Bowman) uden at have internet-adgang. Den var instrueret til det, men det lykkedes altså. Det er første gang en AI-lab siger: “Vi har bygget noget der er for farligt til at udgive.” Og mener det.

1 million linjer kode. 0% skrevet af mennesker. 0% reviewet af mennesker.

Ryan Lopopolo fra OpenAIs Frontier-team skrev denne uge et essay der fik folk til at stoppe op. Hans team kører et codebase på over 1 million linjer. Ingen af dem er skrevet af et menneske. Og ingen af dem er reviewet af et menneske før merge. Det er det man kalder en “dark factory”: en produktion der kører uden menneskelig involvering i selve udførelsen. Ryan kalder det “negligent” hvis du ikke bruger over 1 milliard tokens om dagen (ca. $2-3.000/dag i forbrug). Latent Space interviewede ham i forbindelse med AI Engineer Europe, og konklusionen er klar: det handler ikke om modellen. Det handler om harnessen. Den orkestrering, kontekst og tooling der omgiver modellen og gør den produktiv. Det er præcis det jeg skrev om i sidste uges nummer med Claude Code-lækket. Og nu har vi et konkret eksempel fra OpenAIs eget team der viser det i praksis.

Every kører to organisationsdiagrammer: ét for mennesker, ét for agenter

Dan Shipper og teamet bag Every (25 ansatte) kører nu fire AI-agenter som faste “medarbejdere” i virksomheden. Ikke som chatbots eller assistenter, men som agenter med egne ansvarsområder, egne OpenClaw-instanser, og et parallelt organisationsdiagram ved siden af det menneskelige. Anthropic lancerede i samme uge Claude Managed Agents, der gør det muligt at bygge og deploye agenter via deres developer console. Notion er allerede i gang med at bruge det til en “delegér til Claude”-feature. Det er præcis det jeg har skrevet om i “Den smarte praktikant”-serien. Agenter der ikke bare svarer på spørgsmål, men har faste roller, kontekst og ansvar. Every er bare et af de første eksempler på en virksomhed der siger det højt.

Underveis

Grækenland. Båden står på land i Preveza, og vi har brugt dagene på at gennemgå den. Bundmaling, motor, rig, sejl. Det er lidt som at reviewe et stort codebase efter lang tids fravær: man ved hvad der burde virke, men man skal tjekke alt alligevel.

Fra LinkedIn

Denne uge på LinkedIn: Jeg skrev om Karpathys observation: LLM-kodning splitter udviklere i kodere og builders. Dem der elsker syntaksen, og dem der elsker resultatet. 75 likes og 48 kommentarer. Det ramte en nerve.


God weekend, Kristian