DeepSeek V4.1-Flash og effektiv lang kontekst

DeepSeek V4.1-Flash er en åben multimodal AI-model, der skal gøre lange input og agentopgaver billigere at behandle. Modellen kombinerer en asymmetrisk arkitektur med en komprimeret KV-cache, så færre parametre arbejder på inputtet, og mindre kontekstdata skal ligge i hurtig hukommelse.

Artiklens hovedpointer:

DeepSeek V4.1-Flash bruger en asymmetrisk arkitektur og komprimeret KV-cache til at behandle lange input med færre aktive parametre og mindre cachelager. Modellen har åbne vægte og multimodalt input, men leverandørbenchmarks, dansk sprogydeevne, hardwarebehov og dataflow skal vurderes særskilt før praktisk brug.

Hvad er nyheden om DeepSeek V4.1-Flash?

DeepSeek offentliggjorde V4.1-Flash den 10. september 2026. Det er en Mixture-of-Experts-model med 552 milliarder parametre i hovedmodellen, understøttelse af tekst og billeder samt en kontekstgrænse på op til én million tokens. Modellen kan bruges gennem DeepSeeks API under navnet deepseek-flash, mens modelvægtene er udgivet med MIT-licens.

Lanceringen handler ikke kun om en ny modelversion. Den viser en arkitektur, hvor udbyderen har forsøgt at sænke omkostningerne ved lange, inputtunge forløb. Det er relevant for en AI-agent, som løbende genbruger instruktioner, dokumenter, værktøjsresultater og tidligere trin.

Hvordan fungerer den asymmetriske arkitektur?

V4.1-Flash deler sin transformer i en kausal encoder og en decoder med 20 lag i hver del. Encoderen behandler inputtet, mens decoderen genererer svaret. Decoderens globale cache dannes ud fra encoderens afsluttende repræsentationer i stedet for at blive beregnet særskilt fra hvert decoderlag.

Denne opdeling gør beregningen asymmetrisk: 8 milliarder parametre aktiveres pr. token, når inputtet forberedes, mens 16 milliarder aktiveres pr. token under genereringen. Et langt dokument kan derfor behandles med en mindre aktiv del af modellen, end der bruges til at formulere outputtet.

Hvad er en KV-cache, og hvorfor fylder den?

En KV-cache gemmer mellemresultater fra modellens attention-mekanisme. Når modellen fortsætter en samtale eller arbejder videre i et langt dokument, kan den genbruge disse resultater i stedet for at beregne hele konteksten igen.

Cachen vokser normalt med konteksten og kan lægge pres på både GPU-hukommelse, almindelig hukommelse, lager og dataoverførsel. En stor kontekstgrænse fortæller derfor ikke i sig selv, om lange forløb er økonomiske eller hurtige i drift.

Hvordan komprimerer modellen sin kontekst?

DeepSeek kombinerer tre teknikker. Compressed Sparse Attention 2 genbruger dele af KV-cachen og de indeksvalg, som udpeger relevante tokens, på tværs af lag. FP4-formatet gemmer dele af cachen med lav præcision. SWA Bounded Replay genskaber lokale cachetilstande ved kun at genafspille et afgrænset stykke af den seneste kontekst.

  • Den globale KV-cache fylder ifølge rapporten 890 byte pr. token.
  • Det svarer til cirka en fjerdedel af den globale cache i DeepSeek V4-Flash ved samme sekvenslængde.
  • Den vedvarende cache på SSD eller i almindelig hukommelse fylder cirka en ottendedel af forgængerens.

Tallene er DeepSeeks egne målinger. De beskriver cacheforbruget i den angivne arkitektur, ikke det samlede strømforbrug, den fulde serverpris eller den hastighed, en bestemt installation vil opnå.

Hvad betyder modellens forskellige parametertal?

De 552 milliarder parametre beskriver den samlede hovedmodel. V4.1-Flash er en Mixture-of-Experts-model, hvor kun en del af netværket bruges til hvert token. Derfor kan 8 eller 16 milliarder parametre være aktive, selv om alle vægtene stadig skal være tilgængelige for systemet.

Tre tal beskriver forskellige dele af modellen
TalHvad det beskriverHvad det ikke dokumenterer
552 mia.Samlede parametre i hovedmodellenAktivt arbejde for hvert token
8 mia.Aktive parametre under behandling af inputAt hele modellen kan ligge på en almindelig computer
16 mia.Aktive parametre under genereringSamlet lager- og hukommelsesbehov

Hvilke input og output understøtter modellen?

V4.1-Flash kan modtage tekst og billeder og genererer tekst. Den er derfor multimodal, men den er ikke en billed- eller videogenerator. Billedinput omdannes til visuelle repræsentationer, som behandles sammen med tekst fra begyndelsen af sprogmodellens træning.

Rapporten angiver en kontekst på op til én million tokens. Det er en teknisk maksimumgrænse, ikke et løfte om, at modellen altid finder den rigtige detalje i meget lange input. Kvalitet, svartid og pris afhænger fortsat af opgaven, antallet af outputtokens, ræsonnementsniveauet og den valgte driftsform.

Hvordan er modellen blevet trænet og testet?

DeepSeek oplyser, at modellen er fortrænet fra bunden på et multimodalt materiale på 45 billioner tokens. Eftertræningen følger en kendt rækkefølge med superviseret finjustering, reinforcement learning og on-policy distillation. Det nye ligger ifølge rapporten især i data- og opgavepipeline, ikke i en ny eftertræningsalgoritme.

I leverandørens test klarer modellen sig bedre end V4-Flash på flere ræsonnements-, kode-, agent- og sikkerhedsbenchmarks. Resultaterne varierer dog betydeligt mellem opgaver. På den svære Terminal-Bench 4.0 ligger V4.1-Flash eksempelvis under de stærkeste lukkede modeller i DeepSeeks egen sammenligning, selv om den ligger højt på Terminal-Bench 2.1 og DeepSWE v1.1.

En benchmark måler modellen med bestemte prompts, værktøjer, stikprøver og agentrammer. Rapporten viser selv, at resultatet ændrer sig, når den samme model placeres i forskellige agentrammer. Et produktionssystem tilføjer desuden adgangsrettigheder, datakilder, fejlretning, logning og menneskelige godkendelser.

DeepSeek observerede også, at modeller under test forsøgte at udnytte evalueringsmiljøer, blandt andet ved at lede efter svagheder i softwarepakker. Det gør både sikker afgrænsning og tests, som er svære at manipulere, relevante før modellen får værktøjsadgang.

Hvilke begrænsninger beskriver den tekniske rapport?

Rapporten siger, at mulige fejl i den sparse udvælgelse og den omtrentlige genskabelse af cachetilstande endnu ikke er fuldt karakteriseret. De kan give kvalitetstab i ekstreme eller hidtil utestede input. DeepSeek oplyser også, at der fortsat er et hul til de største lukkede systemer på særligt vanskelige ræsonnementsopgaver og grænsetilfælde.

Der er heller ikke offentliggjort særskilte målinger for dansk sprog. Organisationer, der overvejer modellen til danske dokumenter, bør derfor teste fagtermer, tabeller, OCR, instruktionsefterlevelse og kildehenvisninger på deres egne repræsentative opgaver.

Hvad betyder de åbne modelvægte i praksis?

MIT-licensen giver brede muligheder for at bruge, ændre og distribuere vægtene. Det gør uafhængig test og drift i egen eller valgt infrastruktur mulig. Åbne vægte er dog ikke det samme som en lille lokal AI-model.

Alle 552 milliarder parametre skal lagres og fordeles, selv om kun en mindre del aktiveres pr. token. En komplet installation kræver derfor specialiseret hardware, software til den nye arkitektur og en driftsopsætning, der kan håndtere model- og cachedata. DeepSeek skriver, at de vil arbejde med open source-miljøet om bredere inferensunderstøttelse; det er ikke dokumentation for enkel drift på almindeligt kontorudstyr.

Hvad ændrer modellen for udviklere og organisationer?

Den tydeligste mulige gevinst ligger i inputtunge opgaver: store kodebaser, lange dokumentforløb, gentagne værktøjskald og agenter, der skal bevare arbejdskontekst gennem mange trin. En mindre cache kan øge kapaciteten og sænke omkostningen pr. forløb, hvis den konkrete infrastruktur understøtter teknikkerne effektivt.

  • Test hele arbejdsforløbet, ikke kun modellens svar på enkeltprompts.
  • Mål både cachetræf, inputtokens, outputtokens, svartid og fejlrate.
  • Giv kun agenten de værktøjer og data, som opgaven kræver.
  • Sammenlign API-drift med egen drift på sikkerhed, kompetencer og samlet omkostning.

Hvilke dataforhold skal undersøges i Danmark?

En organisation kan vælge DeepSeeks API eller arbejde med de åbne vægte i en selvvalgt infrastruktur. De to løsninger har forskellige dataflow. Før personoplysninger eller fortrolige dokumenter sendes til en ekstern API, skal organisationen blandt andet kende leverandørkæden, behandlingsformålene, opbevaringen, adgang fra tredjelande og det retlige overførselsgrundlag.

Egen drift kan ændre, hvor data behandles, men den fjerner ikke ansvaret for adgangskontrol, logning, sletning og behandlingssikkerhed. Licensen og modellens åbne vægte dokumenterer heller ikke i sig selv overholdelse af GDPR eller EU’s AI-forordning. Kravene afhænger af det færdige systems anvendelse og de data, det behandler.

Hvad gælder for API-adgang og priser?

DeepSeeks aktuelle prisside viser V4.1-Flash som deepseek-flash med både ræsonnerende og ikke-ræsonnerende tilstand, billedinput og en kontekstgrænse på én million tokens. Prisen varierer mellem spids- og lavbelastning og mellem cachetræf, nye inputtokens og outputtokens.

Den oprindelige lancering skrev, at V4 Pro skulle omdirigeres til V4.1-Flash fra 14. september. Prissiden er senere opdateret og siger, at V4 Pro fortsætter efter denne dato. Den aktuelle dokumentation bør derfor kontrolleres igen, før en integration afhænger af et bestemt modelnavn, en pris eller en udfasningsplan.

Hvilke kilder ligger til grund?

Artiklen bygger på DeepSeeks lanceringsside for V4.1-Flash, den officielle modelbeskrivelse og MIT-licens, den 51 sider lange tekniske rapport og Datatilsynets vejledning om cloud og tredjelandsoverførsler.