Gemini 4 Argon er Googles nye frontier-model til langvarige opgaver i softwareudvikling, vidensarbejde og cybersikkerhed. Modellen er annonceret, men er foreløbig kun ved at blive åbnet for udvalgte cyberforsvarere. En grænse på én million outputtokens giver plads til længere svar og arbejdsforløb; den dokumenterer ikke i sig selv, at modellen arbejder fejlfrit.
Gemini 4 Argon er annonceret til lange opgaver i kodning, vidensarbejde og cyberforsvar, men adgangen er foreløbig begrænset til udvalgte testere. Modellen har en oplyst grænse på én million outputtokens; dens testresultater, pris og sikkerhedsforanstaltninger siger endnu ikke, hvordan den vil fungere på danske arbejdspladser.
Hvad har Google annonceret?
Google præsenterede Gemini 4 Argon den 30. september 2026. Ifølge lanceringen kan modellen arbejde med kode, dokumenter, diagrammer og længere videoer som led i flertrinsopgaver. Den første udrulning sker gennem Fairwind-programmet til betroede cyberforsvarere, mens Google indsamler erfaringer og justerer sikkerhedsforanstaltninger før bredere adgang.
Hvad betyder én million outputtokens?
En outputtoken er en del af det, modellen producerer, eksempelvis tekst eller kode. Google hæver den oplyste grænse for output fra 64.000 til én million tokens. Det er en grænse for modellens mulige output, ikke en oplysning om, hvor meget input den kan læse i samme forespørgsel.
Længere output kan give plads til mere omfattende kodeændringer og analyser i ét forløb. En lang svargrænse fjerner dog ikke behovet for at kontrollere mellemresultater, kildehenvisninger og slutprodukt.
Inputgrænse, outputgrænse og agentens lagrede tilstand er tre forskellige forhold. Inputgrænsen bestemmer, hvor meget materiale modellen kan modtage ad gangen. Outputgrænsen bestemmer, hvor meget den kan levere. En agents tilstand afgør, hvad systemet gemmer mellem trin. Google oplyser den nye outputgrænse i lanceringen, men den må ikke forveksles med en garanti for, at alle tidligere oplysninger bevares gennem en lang opgave.
Hvordan adskiller modellen sig fra en AI-agent?
Argon er en model. En AI-agent er et system, som kombinerer en model med instruktioner, værktøjer, hukommelse og rettigheder til at udføre trin i en arbejdsgang. Når Google beskriver Argon-agenter, indgår modellen altså i et større system. En høj modelscore dokumenterer ikke automatisk sikker værktøjsbrug eller korrekt håndtering af fejl i en konkret installation.
Hvilke opgaver viser Google eksempler på?
Google beskriver intern brug til fejlfinding, kodemigrering, forskning og tekstproduktion. Et eksempel er arbejde med at flytte C- og C++-kode til Rust. Google skriver samtidig, at ændringer i kritiske systemer gennemgår automatiske og manuelle kontroller, emuleringstests og gennemgang før produktionsbrug.
Netop migrationsarbejdet viser forskellen mellem at producere kode og at indføre den. Et forslag kan kompilere uden at have samme ydelse, sikkerhed eller adfærd som den gamle komponent. Googles eksempel med videodekoderen libgav1 omfattede gentagne profileringseksperimenter og sammenligning af videooutput; det er den efterfølgende kontrol, der gør resultatet anvendeligt.
- I softwarearbejde kan modellen foreslå og afprøve ændringer over mange trin.
- I vidensarbejde kan den sammenholde dokumenter, diagrammer og video.
- I cyberforsvar kan den hjælpe med at finde, efterprøve og rette sårbarheder under kontrollerede rammer.
Hvad siger testresultaterne?
Google oplyser 77,9 procent på DeepSWE v1.1 for længere softwareopgaver, 51,3 procent på Zapier AutomationBench for gennemførelse af forretningsopgaver og 68 procent på CWE-bench v1 for rettelse af sårbarheder. Det er resultater fra bestemte testmiljøer og bør ikke læses som succesrater for vilkårlige opgaver på en arbejdsplads.
En uafhængig modelevaluering eller en lokal afprøvning kan afdække forhold, som en offentlig benchmark ikke måler, eksempelvis fagsprog, dokumentformater og behov for menneskelig godkendelse.
Testene måler også forskellige ting. DeepSWE retter sig mod softwareopgaver over længere forløb, AutomationBench mod udførelse af forretningsprocesser og CWE-bench mod reparation af kendte sårbarheder. En score på den ene test kan derfor hverken lægges sammen med eller direkte overføres til en anden. Google omtaler desuden resultater fra interne cybertests, hvor opgaver og betingelser ikke er fuldt beskrevet offentligt.
Hvorfor får cyberforsvarere adgang først?
Google fremhæver modellens evne til at finde og rette sikkerhedshuller, men beskriver også risikoen for misbrug af samme kapacitet. Udvalgte forsvarere og Googles interne teams får ifølge lanceringen adgang uden de sædvanlige cyberbegrænsninger. Det er en afgrænset ordning og siger ikke, at fremtidige almindelige brugere får samme adgang.
Google nævner overvågning af handlinger og ræsonnement, test mod prompt injection og afskærmede testmiljøer som dele af sikkerhedsarbejdet. Det er beskrevne foranstaltninger, ikke en garanti mod fejl eller misbrug.
Prompt injection opstår, når en model møder ondsindede instruktioner i materiale, den egentlig skulle behandle som data, eksempelvis en webside eller en fil. En robusthedsscore i én test er relevant, men beskytter ikke alene de værktøjer og rettigheder, som et konkret agentsystem får adgang til. Adgangsbegrænsning, logning og menneskelig godkendelse af væsentlige handlinger ligger derfor på systemniveau.
Hvornår bliver Argon bredt tilgængelig?
Google oplyser ingen fast dato for generel adgang. Planen er at åbne for udviklere, virksomheder og forbrugere efter den første testfase, begyndende med betalende API-kunder og Google AI Ultra-abonnenter. Den nuværende meddelelse dokumenterer derfor hverken adgang for alle eller særskilt tilgængelighed i Danmark.
Hvad betyder den annoncerede pris?
Google angiver en introduktionspris på 2 dollar pr. million inputtokens og 10 dollar pr. million outputtokens. Cachede inputtokens får efter annonceringen 95 procent rabat. En fodnote angiver senere priser på 4 og 20 dollar, når introduktionsperioden udløber, men oplyser ingen slutdato. Priserne gælder den planlagte modeladgang og er ikke et bevis på, at API’et allerede er åbent.
Ved lange forløb afhænger udgiften af faktisk forbrug af både input, output og eventuelle gentagne forsøg. En lav pris pr. token er derfor ikke det samme som en lav pris pr. færdig opgave.
Hvad ændrer det for arbejdspladser i Danmark?
Hvis modellen bliver tilgængelig lokalt, kan udviklere afprøve den på længere kodeopgaver, og vidensmedarbejdere kan sammenligne dens analyser med eksisterende arbejdsmetoder. Et praktisk kontrolpunkt er at måle fejl, tid og omkostning på egne opgaver, før et testresultat overføres til drift. Gemini 3.8 Flash er et andet modelspor; resultater og adgangsvilkår for de to modeller bør holdes adskilt.
Googles lancering dokumenterer ikke kvaliteten af Argons svar på dansk. Opgaver med danske dokumenter, fagtermer eller myndighedssprog kræver derfor særskilt afprøvning, når adgang og vilkår er kendt.
Hvilke data- og sikkerhedskontroller er relevante?
Hvis en organisation sender kildekode, kundedokumenter eller andre personoplysninger til en cloudtjeneste, afhænger vurderingen af de konkrete aftaler, leverandørkæden, formålene og eventuelle overførsler til tredjelande. Datatilsynets cloudvejledning kræver overblik over behandlingerne og en risikovurdering. Googles beskrivelse af modelsikkerhed fastslår ikke i sig selv, at en bestemt brug opfylder GDPR.
En organisation kan adskille eksperimenter med ufølsomme testdata fra senere behandling af rigtige sager. Ved agentbrug bør den også fastlægge, hvilke værktøjer modellen må kalde, hvilke ændringer der kræver godkendelse, og hvordan handlinger logges.
- Afprøv modellen på et afgrænset datasæt og registrér både korrekte og fejlagtige resultater.
- Undersøg dataflow, opbevaring, underleverandører og de aftaler, der gælder for den valgte adgangsform.
- Giv en eventuel agent de mindst nødvendige rettigheder, og kræv gennemgang før ændringer i produktionssystemer.
Hvilke begrænsninger står tilbage?
Argon er endnu ikke bredt tilgængelig, og Google har ikke offentliggjort særskilte danske resultater. De oplyste testscorer er ikke en samlet måling af pålidelighed i finansielle, juridiske eller offentlige arbejdsgange. Selv en model, der kan skrive meget lange svar, kan lave faktuelle fejl, overse instruktioner eller foreslå kodeændringer, som kræver menneskelig gennemgang.
Hvilke kilder ligger til grund?
De konkrete modeloplysninger stammer fra Googles lancering af Gemini 4 Argon. Sikkerhedsrammen beskrives af Google DeepMind, mens Datatilsynets cloudvejledning danner grundlag for afsnittet om personoplysninger.