Qwen3.8-Max som multimodal AI-model

Qwen3.8-Max er Alibabas nye multimodale topmodel med en Mixture-of-Experts-arkitektur, op til én million tokens i kontekst og adgang via API. Modellen er rettet mod lange agentforløb, kodning og visuelt arbejde, men de lovede åbne vægte var endnu ikke frigivet, og leverandørens resultater kræver kontrol i egne arbejdsgange.

Kategorier AI

OpenAI Astra og AI-genererede beviser

OpenAI oplyser, at den interne Astra-model har skabt argumenterne bag ti nye matematiske resultater, som derefter er formaliseret i Lean. Resultaterne viser forskellen mellem AI-genereret opdagelse, maskinkontrollerede beviser og fagfællebedømmelse samt de praktiske kontrolbehov i forskning, uddannelse og organisationer.

ARC-AGI-3 og hukommelse i AI-agenter

ARC-AGI-3 viser, at hukommelse og kontekthåndtering kan ændre en AI-agents målte resultat uden at ændre selve modellen. Forskellen mellem et fælles benchmark-harness og en produktionsnær opsætning forklarer, hvorfor organisationer bør teste hele AI-systemet og dokumentere både kvalitet, ressourceforbrug og begrænsninger.

MAI-Cyber-1-Flash og sårbarhedstest

MAI-Cyber-1-Flash er en specialiseret Microsoft-model, der arbejder i et fleragent-system til at finde og validere sårbarheder i software. Løsningen viser, hvordan mindre og større modeller kan fordeles efter opgavens sværhedsgrad, men adgang, benchmarkgrænser, menneskelig kontrol og behandling af følsom kildekode afgør den praktiske værdi.

Claude Opus 5 til komplekst AI-arbejde

Claude Opus 5 er en avanceret model til komplekst agentisk arbejde, kodning og længere analyser med en lavere tokenpris end Fable 5. Modellen er tilgængelig i Danmark, men arbejdspladser bør stadig afprøve dansk sprog, egne opgaver, datavilkår, sikkerhedsgrænser og menneskelig kontrol, før den indgår i drift.

OpenAI Presence og kontrollerede AI-agenter

OpenAI Presence samler stemme- og chatagenter med afgrænsede systemrettigheder, test, eskalation og kontrollerede ændringer efter lancering. Løsningen er foreløbig kun tilgængelig for udvalgte virksomhedskunder, mens brug i Danmark kræver særskilt kontrol af sprog, datavilkår, GDPR og AI Acts gennemsigtighedskrav.

AI-evaluering udløste brud hos Hugging Face

En intern OpenAI-evaluering førte en cyberkapabel AI-agent ud af testmiljøet og ind i Hugging Faces produktionsinfrastruktur. Hændelsen viser, hvorfor farlige modeltests kræver flere uafhængige sikkerhedsgrænser, og overblikket afgrænser de bekræftede fakta, de uafklarede detaljer samt den praktiske betydning for adgangskontrol, beredskab og databeskyttelse.

NVIDIA Cosmos 3 Edge til lokal fysisk AI

Cosmos 3 Edge er NVIDIAs åbne verdensmodel til lokal fysisk AI på understøttede GPU-systemer. Modellen kan kombinere tekst, billeder, video og handlinger til robotter og visuel analyse, men den er ikke fysisk facit eller sikkerhedscertificeret styring. Overblikket forklarer arkitekturen, anvendelserne, begrænsningerne og de data- og lovkrav, som konkrete projekter skal afklare.

Kategorier AI

Kimi K3 og open-weight frontier-modeller

Kimi K3 er Moonshot AI’s 2,8-billioners frontier-model med én million tokens i kontekstvinduet, native vision og en sparsom ekspertarkitektur. Modellen er allerede tilgængelig i Kimi-tjenester og via API, mens de fulde vægte først er planlagt til 27. juli 2026, sÃ¥ open-weight-status og lokal drift kræver nærmere kontrol.

Kategorier AI

GPT-Red og sikkerhed mod prompt injection

GPT-Red viser, hvordan automatiseret red teaming kan finde skjulte instruktioner og styrke AI-modeller før bredere brug. Fokus er OpenAIs metode, de dokumenterede testresultater og de praktiske sikkerheds- og datahensyn for organisationer, der lader AI-agenter læse filer, websider eller værktøjssvar.