Grok 4.6 er xAI’s opgradering til flertrinsarbejde, kodning og visuelle projekter, hvor en model skal holde retning gennem længere forløb. Lanceringen viser målbare forbedringer over Grok 4.5, men dokumenterer ikke, at modellen kan arbejde uden kontrol eller levere samme kvalitet på dansk.
Grok 4.6 er udviklet til længere agentforløb, kodning og interaktive projekter, men modellen er ikke et færdigt autonomt system. Overblikket omfatter træningen, leverandørens benchmarkresultater, pris og adgang samt praktiske kontrolpunkter for dansk sprog, værktøjsrettigheder, dataflow, GDPR og AI Act.
Hvad er Grok 4.6?
xAI lancerede Grok 4.6 den 12. august 2026 som en videreudvikling af Grok 4.5. Modellen er målrettet opgaver, der strækker sig over mange trin, blandt andet research, analyse, arbejde på tværs af en kodebase samt udvikling af interaktive og visuelle projekter.
Grok 4.6 er en generel sprogmodel, ikke en færdig autonom medarbejder. For at udføre handlinger skal den indgå i et system med instruktioner, værktøjer, adgangsrettigheder og kontrol af resultater. Den tekniske forskel mellem model og system er central, når en AI-arbejdsgang skal vurderes.
Hvad er ændret fra Grok 4.5?
xAI fremhæver især længere agentforløb, mere omfattende interaktivt arbejde og stærkere første udkast til visuelle applikationer. I virksomhedens egne forsøg foretog modellen oftere test og kontrol af sit arbejde under længere forløb. Kilden offentliggør dog ikke en særskilt fejlrate for denne selvkontrol.
Ændringen handler derfor mindre om én ny brugerfunktion og mere om modellens evne til at bevare en opgave gennem flere handlinger. Den kan eksempelvis undersøge et ukendt område, strukturere en applikation, implementere centrale funktioner og fortsætte efter feedback. Hvert trin kan stadig bygge videre på en fejl fra et tidligere trin.
Hvordan blev modellen trænet?
Grok 4.6 fik ifølge xAI en længere supplerende træningsrunde end Grok 4.5. Træningen brugte kuraterede modelgenererede data om ræsonnement og avancerede tekniske emner, tekniske data samt en forbedret optimerings- og træningsmetode.
Efter grundtræningen brugte xAI Grok 4.5 til at skabe nye forløb til supervised fine-tuning på tværs af ræsonnementsniveauer, agentmiljøer, naturvidenskab, softwareudvikling og vidensarbejde. Problematiske forløb blev sorteret fra med modelbaserede kontroller. Den efterfølgende reinforcement learning omfattede blandt andet generel kodning, webudvikling, optimering af beregningskerner og computerstøttet design.
Beskrivelsen viser, at modellen er trænet til at fungere i bestemte agentmiljøer. Den oplyser ikke datamængde, træningsberegning, fuld datasammensætning eller resultater fra en ekstern audit.
Hvad viser benchmarkresultaterne?
xAI rapporterer fremgang over Grok 4.5 på alle de ti viste evalueringer. Tabellen nedenfor gengiver fem af dem. Resultaterne er leverandørens egne målinger, og højere tal er bedre inden for hver benchmark.
| Evaluering | Grok 4.5 High | Grok 4.6 High |
|---|---|---|
| AA Intelligence Index | 56 | 61 |
| GDPVal-AA v2 | 1526 | 1753 |
| CursorBench v3.2 | 66,7 procent | 69,9 procent |
| DeepSWE v1.1 | 54,0 procent | 65,9 procent |
| Terminal-Bench v3.0 | 15,7 procent | 26,0 procent |
En benchmark afgrænser modeller, værktøjer, tidsbudget og bedømmelse. Den viser derfor præstation på et bestemt opgavesæt, ikke sandsynligheden for et korrekt resultat i en vilkårlig organisation. xAI oplyser desuden, at sammenligningstallene for andre modeller er hentet fra udviklernes systemkort eller offentlige ranglister. Tallene er ikke en fælles uafhængig test af alle modeller under identiske driftsforhold.
Hvad betyder langvarige agentopgaver?
En langvarig agentopgave består af flere modelkald og værktøjshandlinger, hvor senere trin afhænger af tidligere resultater. Modellen kan læse filer, søge information, foreslå en ændring, køre en test og rette sit udkast. Det adskiller sig fra en enkelt chatbesked, der giver ét svar uden efterfølgende handlinger.
Længden handler ikke kun om et stort kontekstvindue. Systemet skal også bevare målet, registrere tilstand, håndtere fejl og beslutte, hvornår arbejdet er færdigt. Mere kontekst kan indeholde flere oplysninger, men garanterer ikke korrekt prioritering eller konsekvent værktøjsbrug.
Hvad kan modellen bruges til?
Den dokumenterede profil retter sig primært mod udviklere og teams, som allerede har et agentmiljø omkring modellen. Relevante opgavetyper omfatter:
- undersøgelse og ændring af kode på tværs af flere filer
- research og sammenstilling af oplysninger i flere trin
- første versioner af webapplikationer og interaktive brugerflader
- tekniske arbejdsgange, hvor modellen kan køre test og reagere på resultater
Listen beskriver opgavetyper, ikke dokumenteret fejlfri automatisering. En realistisk anvendelse afgrænser først data, værktøjer og tilladte handlinger og lader derefter modellen arbejde inden for disse rammer.
Hvad dokumenterer lanceringen ikke?
xAI skriver, at sikkerhedsforanstaltningerne er forbedret, og at Grok 4.6 har gennemgået virksomhedens bredeste testpakke før lancering samt efterfølgende og eksterne test. Lanceringssiden offentliggør ikke en metode, detaljerede sikkerhedsscorer eller resultater fra de nævnte tredjeparter. Formuleringen kan derfor ikke stå alene som risikovurdering.
Kilden dokumenterer heller ikke særskilte resultater for dansk sprog, faktuel nøjagtighed i lokale fagområder eller stabilitet gennem vilkårligt lange forløb. En model kan forbedre sig på kodning og værktøjsbrug og stadig producere AI-hallucinationer, misforstå en instruks eller stoppe for tidligt.
Hvad koster Grok 4.6, og hvor findes den?
Ved lanceringen var Grok 4.6 tilgængelig i Cursor, Grok Build, xAI’s API samt gennem OpenRouter, Vercel og Cloudflare. xAI angav en startpris på 2 amerikanske dollar pr. million inputtokens og 6 dollar pr. million outputtokens. En hurtig variant kostede det dobbelte.
Den samlede pris afhænger af antal trin, mængden af genbrugt kontekst, værktøjskald, fejlretning og den valgte platform. Et langt agentforløb kan sende den samme historik flere gange og dermed bruge langt flere tokens end et enkelt svar. Lanceringssiden angiver ikke særskilt tilgængelighed i Danmark eller EU, så lokal adgang og de aktuelle priser skal kontrolleres hos den valgte udbyder.
Hvad betyder modellen for arbejdspladser og udviklere?
For softwareteams og andre vidensmiljøer gør Grok 4.6 det mere realistisk at afprøve længere, afgrænsede opgaver i stedet for kun at få forslag til enkelte trin. Gevinsten afhænger af, om systemet kan spare manuelt arbejde uden at flytte en større kontrolopgave til slutningen af forløbet.
En praktisk opdeling kan lade modellen forberede ændringer, mens et menneske godkender adgang til produktionsdata, økonomiske dispositioner, publicering eller andre handlinger med mærkbar konsekvens. En intern AI-politik kan knytte disse grænser til datatyper og opgaver frem for til et bestemt modelnavn.
Hvordan påvirker brugen data og GDPR?
Ved brug af xAI’s API og erhvervstjenester beskriver xAI sig i sin databehandleraftale som databehandler for personoplysninger i kundens input og output. De gældende erhvervsvilkår siger, at brugerindhold ikke anvendes til træning af grundmodeller, og at indhold som udgangspunkt slettes senest 30 dage efter en interaktion. Vilkårene indeholder undtagelser og en særskilt mulighed for API’er med nul datalagring.
Det er kontraktvilkår for bestemte erhvervstjenester, ikke en generel egenskab ved alle Grok-produkter eller partnerintegrationer. Hvis modellen tilgås gennem Cursor, OpenRouter eller en anden platform, kan flere leverandører behandle prompts, kode, værktøjsresultater og logs. Datatilsynet understreger, at den dataansvarlige skal have overblik over hele leverandørkæden. Valg af endpoint, databehandleraftaler, opbevaring, underdatabehandlere og eventuelle tredjelandsoverførsler skal derfor vurderes samlet.
Hvilke EU-krav kan blive relevante?
AI Act knytter organisationens pligter til rollen og den konkrete anvendelse, ikke til navnet Grok 4.6. En kodningsassistent og et system, der bruges til beslutninger om personer, kan derfor udløse forskellige krav. Organisationer, der udbyder eller anvender AI-systemer, skal tage tiltag, som understøtter AI-færdigheder hos de medarbejdere, der arbejder med systemerne.
Hvis en model indgår i et højrisikosystem, følger der strengere krav til blandt andet dokumentation, overvågning og menneskeligt tilsyn. En generel agentmodel er ikke automatisk et højrisikosystem. Formål, berørte personer, data og den handling, systemet må udføre, afgør den praktiske vurdering.
Hvad bør testes før praktisk brug?
- Afprøv modellen på repræsentative danske og engelske opgaver med kendte facit eller klare godkendelseskriterier.
- Mål fejl, tidsforbrug, tokenforbrug og behovet for menneskelig rettelse gennem hele forløbet.
- Begræns værktøjer og rettigheder, og kræv godkendelse før irreversible eller eksterne handlinger.
- Kontrollér dataflow, opbevaring og underdatabehandlere for den konkrete platform og kontotype.
- Test afbrydelse, genoptagelse, fejlslagne værktøjskald og gentagelser, ikke kun vellykkede standardforløb.
En sammenligning med Grok 4.5, en anden model og den eksisterende manuelle proces giver et mere brugbart beslutningsgrundlag end leverandørbenchmarks alene. Testen bør afspejle de sprog, filer, værktøjer og konsekvenser, der findes i det faktiske arbejde.
Hvilke kilder ligger til grund?
Den primære kilde er xAI’s lancering af Grok 4.6. Dataforholdene er kontrolleret mod xAI’s databehandleraftale og erhvervsvilkår. Den lokale GDPR-vinkel bygger på Datatilsynets cloudvejledning, mens rolle-, risiko- og AI-færdighedsvinklen følger EU-Kommissionens spørgsmål og svar om AI-færdigheder.