GLM-5.3-Flash som multimodal AI-model

GLM-5.3-Flash er en ny open-weight-model fra Z.ai, der behandler tekst, billeder, video og filer i samme model. Den kombinerer 320 milliarder samlede parametre med 18 milliarder aktive parametre for at sænke beregningsbehovet, men kræver stadig omfattende infrastruktur ved egen drift.

Artiklens hovedpointer:

GLM-5.3-Flash kombinerer multimodale input og en sparse modelarkitektur, hvor 18 af 320 milliarder parametre aktiveres ad gangen. Få overblik over modellens åbne vægte, aktuelle API-pris, leverandørbenchmarks og de data-, hardware- og kontrolspørgsmål, som udviklere og organisationer bør afklare før praktisk brug.

Hvad blev lanceret med GLM-5.3-Flash?

Z.ai offentliggjorde GLM-5.3-Flash den 26. august 2026. Det er den første model i GLM-5-serien, hvor visuel forståelse er indbygget fra grundtræningen i stedet for tilføjet som en separat komponent. Modellen kan tilgås via Z.ai’s API og Coding Plan, mens modelvægtene er udgivet på Hugging Face under MIT-licensen.

Lanceringen handler derfor både om en cloudtjeneste og om en model, som udviklere kan implementere i egen eller valgt infrastruktur. De to driftsformer giver forskellige vilkår for pris, hardware, databehandling og kontrol.

Hvordan er modellen bygget?

GLM-5.3-Flash er en mixture-of-experts-model. Den har 320 milliarder parametre i alt, men aktiverer cirka 18 milliarder til hvert beregningstrin. En router vælger altså en mindre del af modellen til den konkrete inputsekvens i stedet for at bruge alle parametre hver gang.

Arkitekturen kombinerer lineær og sparse attention. Lineær attention sammenfatter lokale sammenhænge i en løbende tilstand, mens sparse attention udvælger relevante dele af den bredere kontekst. Z.ai oplyser også, at IndexPool komprimerer indeksdata for at begrænse hukommelsesforbruget ved lange input.

Hvad betyder 320 milliarder og 18 milliarder parametre?

De 320 milliarder beskriver modellens samlede kapacitet, mens de 18 milliarder aktive parametre er den del, der typisk indgår i beregningen for et token. Det kan reducere regnearbejdet pr. svar, men hele modellen skal stadig lagres og fordeles på hardware.

Et lavt antal aktive parametre gør derfor ikke automatisk modellen lille. Z.ai sammenligner selv GLM-5.3-Flash med GLM-5.3 og oplyser cirka tre gange mindre attention-beregning og 4,4 gange mindre KV-cache pr. lag. Tallene beskriver leverandørens arkitektursammenligning, ikke det samlede strømforbrug eller prisen i enhver installation.

Hvordan bruger modellen tekst og visuelle input?

Modellen er multimodal og kan ifølge dokumentationen modtage tekst, billeder, video og filer. Den kan eksempelvis fortolke en brugerflade, foreslå kode, køre værktøjer og vurdere et nyt skærmbillede af resultatet. Det skaber en løkke mellem observation, handling og kontrol.

API’et understøtter en kontekst på op til én million tokens. En lang kontekst angiver, hvor meget input modellen teknisk kan modtage i én arbejdsgang; den dokumenterer ikke, at alle detaljer huskes lige præcist, eller at lange svar er faktuelt korrekte.

Hvad viser de offentliggjorte testresultater?

Z.ai rapporterer forbedringer over GLM-5.2 på seks kode- og agenttests. På DeepSWE v1.1 angives 63,4 mod 46,2, og på AutomationBench 48,8 mod 26,2. Modelkortet forklarer flere af testopsætningerne, herunder kontekstgrænser, tidsgrænser og brug af en separat bedømmelsesmodel.

Resultaterne kommer hovedsageligt fra leverandørens egen lancering. Enkelte målinger er udført gennem benchmarkenes officielle tjenester eller af Artificial Analysis, men tabellen er ikke en samlet uafhængig evaluering af modellen. Testscore på kode og agentopgaver dokumenterer heller ikke kvalitet på dansk, datasikkerhed eller stabilitet i en bestemt arbejdsproces.

Hvad koster modellen, og hvor er den tilgængelig?

Z.ai’s API-pris er frem til 9. september 2026 klokken 24.00 i tidszonen UTC+8 angivet til 0,075 dollar pr. million inputtokens og 0,25 dollar pr. million outputtokens. De oplyste listepriser er henholdsvis 0,15 og 0,50 dollar. Prisen for en reel opgave afhænger også af kontekstlængde, antal forsøg, værktøjskald og den omgivende agent.

Modellen er desuden tilgængelig i GLM Coding Plan og som modelvægte. Kilderne dokumenterer ikke en særskilt EU-region, lokal kontraktform eller generel dansk sprogkvalitet. De forhold skal derfor kontrolleres i den valgte adgangsform.

Kan GLM-5.3-Flash køre lokalt?

Modelvægtene kan hentes, og Z.ai nævner blandt andet SGLang, vLLM, TokenSpeed og KTransformers som understøttede inferensrammer. MIT-licensen giver brede muligheder for at bruge og ændre koden og vægtene.

Lokal AI betyder i denne sammenhæng ikke en model til en normal bærbar computer. Hugging Face angiver cirka 321 milliarder parametre, og selv komprimerede udgaver kræver betydelig lagerplads, hukommelse og specialiseret opsætning. Egen drift flytter samtidig ansvar for adgangskontrol, opdateringer, logning og overvågning til organisationen.

Hvilke opgaver retter modellen sig mod?

Z.ai fremhæver kodearbejde, visuel kontrol af brugerflader, dokumenter, regneark, præsentationer, video og computerbrug. Den praktiske forskel fra en ren tekstmodel er, at modellen kan bruge synligt feedback som del af en flertrinsopgave.

  • En udvikler kan lade modellen sammenligne en implementeret side med referenceskærmbilleder.
  • Et dokumentworkflow kan kombinere tekst, tabeller og gengivne sider i samme kontrolforløb.
  • En agent kan aflæse en grænseflade, udføre en handling og kontrollere den nye tilstand.

Det er eksempler på arbejdsgange, ikke dokumentation for fejlfri autonom udførelse. Værktøjsrettigheder, testmiljø og menneskelige godkendelser ligger uden for selve modellen.

Hvad dokumenterer lanceringen ikke?

Kilderne indeholder ingen særskilt evaluering af dansk sprog, danske dokumenttyper eller lokale fagområder. De offentliggør heller ikke et fuldt datasæt over fejl på tværs af anvendelser. Modellen bør derfor testes på de konkrete input, filformater og kvalitetskrav, som den skal møde.

  • En benchmarkscore er ikke en garanti for korrekte svar i produktion.
  • En million tokens er en kapacitetsgrænse, ikke et løfte om perfekt genfinding.
  • Åbne vægte er ikke det samme som fuld offentlighed om træningsdata og træningsproces.
  • En agentfunktion er ikke en færdig sikkerhedsmodel for handlinger i eksterne systemer.

Hvad betyder udviklingen for arbejdspladser i Danmark?

Den konkrete nyhed er mest relevant for udviklere og organisationer, der sammenligner API-modeller med egen drift. Open-weight-adgangen kan give større valgfrihed i placering og tilpasning, mens den sparsomme arkitektur peger mod lavere inferensomkostninger for store modeller.

Før brug i dokument-, kode- eller agentarbejde bør kvaliteten måles på dansk og på organisationens egne, lovligt anvendelige testdata. Leverandørens benchmarktabel kan bruges til at vælge forsøg, men ikke som erstatning for en lokal evaluering af fejl, svartid, omkostning og menneskelig kontrol.

Hvilke data- og regelspørgsmål skal afklares?

Ved API-brug skal en organisation kortlægge, hvilke input og filer der sendes, hvor de behandles, hvor længe de gemmes, og hvilke underleverandører der indgår. AI Mentors forklaring af databeskyttelse ved AI-API’er beskriver forskellen mellem adgangskontrol, databehandleraftaler og tekniske begrænsninger. Egen drift kan begrænse overførsel til en ekstern modeltjeneste, men fjerner ikke krav til behandlingsgrundlag, sikkerhed og dokumentation.

EU’s AI-forordning fordeler pligter efter aktørrolle og den konkrete anvendelse. En organisation, der integrerer en generel model i et system, skal derfor afklare sin rolle, formålet med systemet og den tilgængelige dokumentation. Z.ai-kilderne fastslår ikke, hvordan modellen eller en bestemt lokal implementering klassificeres i EU.

Hvordan kan modellen vurderes før praktisk brug?

  1. Vælg repræsentative opgaver på det faktiske arbejdssprog og med kendte facitsvar.
  2. Test tekst, billeder og filer separat, før de kombineres i længere agentforløb.
  3. Mål fejl, svartid og samlet tokenforbrug ved samme kvalitetskrav som alternative modeller.
  4. Begræns værktøjsrettigheder og kræv godkendelse før eksterne eller irreversible handlinger.
  5. Dokumentér dataflow, leverandører, logning, opdateringer og ansvar for menneskelig kontrol.

Denne rækkefølge skelner modelkapacitet fra systemkvalitet. Resultatet afhænger både af modellen og af værktøjer, data, instruktioner, sikkerhedsgrænser og kontrol efter udførelsen.

Hvilke kilder ligger til grund?

Artiklen bygger på Z.ai’s oprindelige lancering af GLM-5.3-Flash, det officielle modelkort på Hugging Face og Z.ai’s aktuelle API-priser. Den lokale vurdering er afgrænset med Datatilsynets vejledning om cloud og EU-Kommissionens oversigt over pligter for generelle AI-modeller.