GPT-Red og sikkerhed mod prompt injection

GPT-Red viser, hvordan automatiseret red teaming kan finde skjulte instruktioner og styrke AI-modeller før bredere brug. Fokus er OpenAIs metode, de dokumenterede testresultater og de praktiske sikkerheds- og datahensyn for organisationer, der lader AI-agenter læse filer, websider eller værktøjssvar.

Fable 5 og sikkerhed mod AI-jailbreaks

Fable 5 viser, hvordan meget kapable AI-modeller kan kræve særskilte sikkerhedsfiltre, når de bruges til kodning og cybersikkerhed. Nyheden forklarer forskellen på almindelig modeladgang, trusted access, jailbreaks og praktiske kontrolpunkter for organisationer, der skal balancere nytte, misbrugsrisiko, databeskyttelse og EU-regler.

OpenAI Daybreak og sårbarheder i software

OpenAI Daybreak viser, hvordan avancerede AI-modeller kan flytte cybersikkerhed fra sårbarhedsfund til kontrolleret patching. Fokus ligger på Codex Security, GPT-5.5-Cyber, menneskelig review og Patch the Planet, samt hvad udviklere og organisationer bør afklare, når kode, logs og sikkerhedsrettelser håndteres med AI.

Hvad er Google DeepMinds AI Control Roadmap for sikre AI-agenter?

Google DeepMinds AI Control Roadmap er en sikkerhedsramme for avancerede AI-agenter, der fÃ¥r adgang til interne systemer. Pointen er ikke, at agenter allerede bevidst handler skadeligt, men at organisationer skal kunne opdage, begrænse og stoppe skadelige handlinger, hvis mere autonome modeller bruges i følsomme arbejdsgange. Hvad har Google DeepMind offentliggjort? Google DeepMind offentliggjorde den 18. … Læs mere

Hvad er OpenAIs Deployment Simulation, og hvorfor ændrer det test af AI-modeller?

OpenAI offentliggjorde 16. juni 2026 en metode kaldet Deployment Simulation. Metoden bruges til at forudsige, hvordan en ny model sandsynligvis vil opføre sig, før den bliver frigivet til brugere. I stedet for kun at teste modellen med særligt udvalgte evalueringsopgaver genskaber OpenAI realistiske samtaleforløb fra tidligere brug og lader en kandidatmodel svare i den sammenhæng. … Læs mere

Hvad betyder USA’s nye AI-ordre for cybersikkerhed og frontier-modeller?

USA’s regering offentliggjorde 2. juni 2026 en ny bekendtgørelse om avanceret kunstig intelligens, cybersikkerhed og sÃ¥kaldte frontier-modeller. Nyheden handler ikke om et enkelt nyt AI-produkt, men om hvordan myndigheder vil samarbejde med modeludviklere om sÃ¥rbarheder, tidlig test og beskyttelse af kritisk infrastruktur. Hvad er den centrale nyhed? Den primære nyhed er, at Det Hvide Hus … Læs mere

Hvad er Project Glasswing, og hvorfor bruger virksomheder AI til at finde sårbarheder?

Anthropic udvidede den 2. juni 2026 programmet Project Glasswing fra en indledende gruppe pÃ¥ omkring 50 partnere til cirka 150 organisationer. Programmet giver udvalgte sikkerhedsteams adgang til modellen Claude Mythos Preview, som bruges til at gennemgÃ¥ kodebaser for sÃ¥rbarheder. Nyheden handler derfor ikke kun om Anthropic, men om en bredere udvikling, hvor AI i stigende … Læs mere

Hvad er tredjeparts-evalueringer af AI-modeller, og hvorfor betyder de mere nu?

OpenAI offentliggjorde 29. maj 2026 en vejledning om, hvordan uafhængige tredjeparts-evalueringer af avancerede AI-modeller bør gennemføres. Nyheden handler ikke om en ny model, men om mÃ¥den modeller bliver testet pÃ¥. Det er relevant, fordi moderne AI-systemer ikke kun svarer pÃ¥ en enkelt prompt. De kan bruge værktøjer, arbejde over mange trin og indgÃ¥ i større … Læs mere

Hvordan bekæmper Microsoft AI-genererede intime billeder uden samtykke?

Microsoft har udvidet sin indsats mod deling af intime billeder uden samtykke, ogsÃ¥ nÃ¥r billederne er AI-genererede. Nyheden handler om rapportering, hash-baseret genkendelse og beskyttelse pÃ¥ tværs af tjenester som Teams Free, OneDrive og Xbox. I Microsofts egen gennemgang af tiltag mod non-consensual intimate imagery beskrives ændringerne som en udvidelse af eksisterende sikkerhedsarbejde. Microsoft nævner … Læs mere

Integration af AI i eksisterende sikkerhedssystemer

Integration af AI i eksisterende sikkerhedssystemer

AI kan styrke eksisterende sikkerhedssystemer, når integrationen afgrænses til tydelige opgaver, kontrollerede dataflow og sporbare beslutninger. Fokus er praktiske valg om adgang, test, drift, leverandørkrav, incident response og stopkriterier, så AI ikke bliver en ny angrebsflade.