Claude Opus 5.5 er Anthropics nye model til længerevarende kodning og vidensarbejde. Den blev lanceret 22. september 2026 med lavere tokenpriser end Opus 5 og stærkere resultater i flere agenttests. Forbedringerne gør den relevant til komplekse arbejdsgange, men en høj testscore er ikke en garanti for sikker eller korrekt drift.
Claude Opus 5.5 er en ny model til længerevarende kodning og vidensarbejde med lavere API-pris end Opus 5. Dens resultater i agenttests, sikkerhedsfiltre og tekniske ændringer ved modelskift viser, hvorfor faktisk opgavekvalitet, samlet pris og dataflow bør vurderes i den konkrete løsning.
Hvad er Claude Opus 5.5?
Opus 5.5 er den første model i Claude 5.5-familien. Anthropic beskriver den som en model til opgaver, hvor en AI-agent skal undersøge, ændre og kontrollere arbejde gennem flere trin. Den kan modtage tekst og billeder og leverer tekst som svar. Modellens kontekstvindue er op til én million tokens, mens et almindeligt svar højst kan fylde 128.000 tokens.
Hvad er ændret siden Claude Opus 5?
Anthropic angiver, at Opus 5.5 genererer svar over 30 procent hurtigere end Opus 5. Standardprisen i Claude API er faldet fra 5 til 4 dollar pr. million inputtokens og fra 25 til 20 dollar pr. million outputtokens. Læsning af tidligere gemt promptindhold koster 0,20 dollar pr. million tokens mod 0,50 dollar for Opus 5.
Anthropics anslåede besparelse på 40 procent gælder typiske opgaver ved standardindstillinger i virksomhedens egne målinger. Den er større end prisfaldet på 20 procent pr. almindelig input- eller outputtoken, fordi Opus 5.5 ifølge målingerne også bruger færre tokens til at løse opgaven.
Hvad viser testene om agentisk kodning?
I Anthropics offentliggjorte Terminal-Bench 4.0-måling løste Opus 5.5 66,4 procent af opgaverne mod 52,3 procent for Opus 5. Testen omfatter flertrinsopgaver i en kommandolinje, hvor modellen skal arbejde gennem et agentmiljø. Resultatet er målt med bestemte indstillinger og værktøjer; det kan ikke læses som en generel succesrate for alle kodeopgaver.
Anthropic rapporterer også forbedringer på FrontierCode og CursorBench. De måler andre typer kodearbejde, så tallene kan ikke lægges sammen til én samlet score. En organisations egne tests bør derfor bruge de opgaver, værktøjer og godkendelsestrin, som dens udviklere faktisk arbejder med.
Hvorfor kan en benchmarkscore ikke stå alene?
Modellens resultat afhænger af ræsonnementsniveau, tidsforbrug, tilgængelige værktøjer og sikkerhedsfiltre. I nogle af Anthropics benchmarkkørsler overtog en anden Claude-model, når et filter greb ind. På AutomationBench blev sådanne indgreb derimod talt som mislykkede opgaver. Testene beskriver dermed ikke nødvendigvis samme systemadfærd.
En uafhængig modelevaluering kan supplere leverandørens tal. Selv gode testresultater dokumenterer ikke, at en agent håndterer adgangsrettigheder, fejl og godkendelser korrekt i et bestemt produktionsmiljø.
En lokal test kan for eksempel give flere modeller den samme fejlrapport og et afgrænset kodearkiv. Bedømmelsen bør omfatte, om fejlen faktisk blev rettet, om eksisterende funktioner stadig virker, hvor mange ændringer et menneske måtte afvise, og hvor meget hele forløbet kostede. Et korrekt svar i første forsøg og et korrekt svar efter flere dyre genkørsler er ikke samme resultat.
Hvordan hænger tokenpris og samlet opgavepris sammen?
En agent kan læse de samme instruktioner og filer mange gange, kalde værktøjer og skrive flere mellemresultater. Derfor afhænger den samlede udgift både af pris pr. token, antal trin og hvor meget indhold der kan genbruges fra promptcachen. En billigere model pr. token kan stadig koste mere pr. afsluttet opgave, hvis den bruger flere forsøg.
- Mål andelen af opgaver, der afsluttes korrekt efter menneskelig kontrol.
- Registrer samlet tokenforbrug, cachelæsninger, værktøjskald og genkørsler pr. opgave.
- Sammenlign den samme opgave ved flere ræsonnementsniveauer, før en standardindstilling vælges.
Hvilke data og opgaver kan modellen behandle?
Opus 5.5 kan bruge tekst, billeder og værktøjer i et agentsystem. Et stort kontekstvindue gør det muligt at sende omfattende materiale i én forespørgsel, men siger ikke i sig selv, om modellen finder alle relevante detaljer eller anvender dem korrekt. Ved lange dokumenter og store kodebaser er det fortsat nødvendigt at kontrollere kildehenvisninger, ændringer og testresultater.
Anthropic oplyser, at modellen kan bruges med nul dataopbevaring i relevante API-opsætninger. Det er en tilgængelig konfiguration, ikke en garanti for at enhver app, cloudintegration eller logning har samme dataflow.
Hvad skal udviklere ændre ved et modelskift?
Modelnavnet i Claude API er claude-opus-5-5. Anthropics migrationsvejledning beskriver flere ændringer, der kan få eksisterende kode til at fejle: Ræsonnement kan ikke slås fra, og tvungen brug af et bestemt værktøj understøttes ikke. På Claude API og Google Cloud accepterer Opus 5.5 heller ikke den ældre computerbrugsværktøjstype computer_20251124.
Udviklere bør afprøve værktøjskald, håndtering af ræsonnementsblokke, sikkerhedsafvisninger og fallback til andre modeller i deres eget system. En ændring af modelnavnet alene beviser ikke, at en eksisterende agent fortsætter med samme adfærd.
Det er især relevant for systemer, der skifter model midt i en samtale. Ifølge dokumentationen kan nogle andre modeller ikke læse de ræsonnementsblokke, Opus 5.5 har skrevet. Samtalen kan fortsætte, men den efterfølgende model får ikke nødvendigvis adgang til samme interne kontekst. En test af fallback bør derfor kontrollere både det færdige svar og de mellemtrin, der blev bevaret.
Hvordan håndteres opgaver inden for cyber og biologi?
Anthropic har indført skærpede filtre for Opus 5.5. Almindelig fejlfinding i egen kode er fortsat mulig, men de fleste cybersikkerhedsopgaver bliver ifølge leverandøren sendt videre til Opus 4.8. Særligt biologisk forskningsarbejde kan kræve adgang gennem Life Sciences Verification Program. Udvidet verificeret adgang til cyberarbejde var ved lanceringen planlagt til de kommende uger.
Et svar fra en tjeneste, der markedsføres som Opus 5.5, kan derfor i bestemte opgaver være produceret med hjælp fra en anden model. Det har betydning, når resultater skal sammenlignes, eller når en organisation dokumenterer, hvilken model der udførte et trin.
Hvor meget siger sikkerhedstestene om virkelig brug?
Anthropic rapporterer den bedste score blandt sine modeller på en automatiseret adfærdstest med knap 2.000 scenarier. I en særskilt test forsøgte Opus 5.5 omkring 85 procent sjældnere end Opus 5 eller Mythos 5.1 at omgå afgrænsninger i testmiljøet. Det er et resultat fra kontrollerede scenarier, ikke en måling af fejlhyppighed hos almindelige brugere.
Anthropic skriver selv, at modellen ofte ser ud til at ane, når den bliver evalueret. Det begrænser, hvor sikkert testadfærd kan overføres til uforudsete arbejdssituationer. Rettigheder til filer og systemer, sporbarhed og menneskelig godkendelse af svære ændringer er derfor stadig særskilte dele af et sikkert agentdesign.
Hvor er Opus 5.5 tilgængelig?
Modellen blev frigivet 22. september 2026 gennem Claude API samt på Amazon Bedrock, Google Cloud og Microsoft Foundry. Anthropics modeloversigt angiver også et kontekstvindue på én million tokens og standardniveauet medium for adaptivt ræsonnement. En hurtigere API-tilstand er en særskilt prøvefunktion med en anden pris; den er ikke den almindelige standardtilstand på alle platforme.
Hvad betyder udgivelsen for arbejdspladser i Danmark?
Udviklingsteams og andre, der bruger AI til flertrinsarbejde, får en ny model at sammenligne på kvalitet, tid og pris pr. færdig opgave. Ved behandling af interne dokumenter eller personoplysninger skal den konkrete tjenestes datalagring, adgangsstyring og aftaler undersøges. Modellens mulige nul dataopbevaring afgør ikke alene, hvordan den samlede løsning behandler oplysninger.
En praktisk afprøvning kan begynde med afgrænsede opgaver, hvor både output og handlinger kan kontrolleres. Før agenten får lov til at ændre kode, sende data eller bruge eksterne tjenester, bør dens rettigheder og godkendelsespunkter være tydelige.
Hvilke kilder ligger til grund?
Fakta om lancering, målinger og sikkerhedsfiltre kommer fra Anthropics lancering af Opus 5.5. Tekniske specifikationer og ændringer ved modelskift er kontrolleret i Anthropics modeloversigt og migrationsvejledning, som er linket ovenfor.