Instruktionsdesign for generativ AI er arbejdet med at formulere præcise opgaver, kontekst og eksempler, så modellen leverer mere relevante, kontrollerbare og efterprøvede svar. Det handler ikke om magiske kommandoer, men om at gøre opgaven, dataene, formatet og kvalitetskravene tydelige.
Instruktionsdesign for generativ AI handler om at gøre opgave, kontekst, format og kvalitetskrav tydelige, så modellen leverer mere kontrollerbare svar. Overblikket dækker praktiske metoder, eksempler, test, sikkerhedsrisici og grænserne for, hvad en god formulering alene kan løse.
Hvad betyder begrebet i praksis?
Begrebet dækker den praktiske disciplin, hvor du designer input til en AI-model, tester svaret og justerer formuleringen, indtil resultatet passer til opgaven. Det bruges især ved store sprogmodeller, men samme tankegang findes også i billed-, lyd- og multimodale modeller, hvor instruktionen beskriver ønsket output.
I praksis består arbejdet af tre dele: at beskrive opgaven, at give relevant kontekst og at kontrollere resultatet. En kort besked kan være nok til simple spørgsmål, mens komplekse opgaver ofte kræver målgruppe, afgrænsning, datagrundlag, formatkrav og kriterier for, hvornår svaret er brugbart.
Det gør feltet tæt forbundet med generativ AI. Hvis du vil forstå forskellen mellem klassiske AI-systemer og modeller, der skaber tekst, billeder eller kode, er det relevant at se på forskellen mellem generativ AI og andre AI-modeller, fordi instruktioner spiller en anden rolle, når modellen producerer nyt indhold.
Hvilke dele består en god AI-instruktion af?
En god AI-instruktion fortæller modellen, hvad den skal gøre, hvorfor opgaven udføres, hvilket materiale den må bruge, og hvordan svaret skal se ud. Google beskriver blandt andet opgave, systeminstruktioner, få eksempler og kontekst som centrale dele af modelinput. Det er en nyttig praktisk ramme, fordi den adskiller mål, baggrund og format.
| Del | Funktion | Praktisk eksempel |
|---|---|---|
| Opgave | Fortæller modellen, hvad den skal levere. | Opsummér et mødenotat i fem beslutninger. |
| Kontekst | Giver baggrund, data, målgruppe eller afgrænsning. | Brug kun de vedlagte noter og skriv til nye medarbejdere. |
| Format | Gør output lettere at kontrollere og genbruge. | Returnér en tabel med ansvarlig, frist og næste handling. |
| Kvalitetskrav | Angiver, hvad modellen skal undgå eller dokumentere. | Marker usikkerhed og undlad fakta, der ikke findes i materialet. |
Jo mere opgaven skal indgå i en arbejdsproces, desto vigtigere er format og kontrolpunkter. En løs instruktion kan give et læsbart svar, men et standardiseret input gør det lettere at gentage opgaven, sammenligne resultater og opdage afvigelser.
Hvordan adskiller instruktioner til AI sig fra almindelig søgning?
En søgemaskine finder typisk dokumenter eller svaruddrag, mens en generativ model beregner et nyt output ud fra input, modeltræning og eventuel tilført kontekst. Derfor bør du ikke skrive til modellen, som om den kun slår noget op. Du beder den om at udføre en opgave, ikke blot finde en side.
Forskellen betyder, at kvaliteten afhænger af både materiale og opgaveformulering. Hvis du beder om en markedsanalyse uden data, kan modellen levere en plausibel, men svagt dokumenteret tekst. Hvis du giver kilder, målgruppe, analyseform og krav om usikkerhedsmarkering, bliver opgaven mere kontrollerbar.
Det er også derfor, begyndere ofte får svingende resultater. En model kan svare flydende, selv når opgaven mangler afgrænsning. En grundlæggende forståelse af hvordan ChatGPT bruges som samtaleværktøj er et godt udgangspunkt, men systematisk instruktionsdesign kræver mere end at stille et enkelt spørgsmål.
Hvornår er få eksempler nyttige?
Få eksempler er nyttige, når modellen skal ramme en bestemt struktur, klassifikation, tone eller beslutningsregel. OpenAI beskriver metoden som en måde at styre en stor sprogmodel mod en ny opgave ved at give et lille antal input- og outputeksempler, uden at selve modellen ændres.
Eksempler er især stærke, når reglen er svær at forklare kort. Hvis en organisation vil have ensartede kategorier for kundebeskeder, kan to eller tre gode eksempler vise forskellen mellem klage, spørgsmål og teknisk fejl. Modellen ser mønsteret og anvender det på nye tilfælde.
Eksempler kan dog også forvrænge svaret, hvis de er for smalle. Hvis alle eksempler ligner den samme sagstype, kan modellen overse variationer i virkelige data. Brug derfor eksempler, der dækker både almindelige tilfælde, grænsetilfælde og det outputformat, du faktisk ønsker.
Hvordan bør du bruge kontekst uden at forvirre modellen?
Kontekst bør være relevant, afgrænset og tydeligt adskilt fra selve opgaven. Det kan være et dokumentuddrag, en målgruppebeskrivelse, en stilguide, en datatabel eller tidligere beslutninger. Formålet er at give modellen de oplysninger, den skal bruge, uden at drukne den i materiale, som ikke påvirker svaret.
En praktisk metode er at inddele input i tydelige blokke: opgave, materiale, begrænsninger og ønsket format. Det gør det lettere for modellen at holde styr på, hvad der er instruktion, og hvad der blot er data. Samtidig bliver det lettere for dig at fejlfinde, når svaret ikke passer.
Hvis modellen skal bruge interne dokumenter, bør du også afgøre, om svaret skal bygge udelukkende på dem. I arbejdsgange med kode, API’er eller automatisering kan samme princip bruges til at holde input, værktøjer og svarformat adskilt. Det er beslægtet med de praktiske overvejelser i ChatGPT for udviklere og API-brug.
Hvordan tester du om en instruktion virker?
Test starter med succeskriterier. Anthropic anbefaler, at du har en klar definition af succes og en måde at teste mod kriterierne på, før du begynder at forbedre en modelinstruktion. Det flytter arbejdet fra mavefornemmelse til en mere kontrolleret proces.
For en tekstgenerator kan kriterierne være korrekthed, dækningsgrad, længde, format, kildetilknytning og fravær af uønskede formuleringer. For en klassifikationsopgave kan du måle, om modellen placerer kendte testeksempler i de rigtige kategorier. For en kodeopgave kan du køre automatiske tests.
- Gem et lille testsæt med repræsentative eksempler.
- Kør den samme instruktion flere gange, hvis opgaven er følsom for variation.
- Kontrollér både gode svar og fejltyper, ikke kun om svaret ser pænt ud.
- Versionér instruktionen, når den bruges i en gentagen proces.
Test er særlig vigtig, når en instruktion indgår i en fælles arbejdsgang. Hvis flere medarbejdere ændrer den samme formulering uden dokumentation, kan kvaliteten ændre sig gradvist uden at nogen opdager årsagen.
Hvilke fejl giver uklare svar?
Den mest almindelige fejl er at bede modellen om for meget på én gang uden prioritering. En formulering som “lav en god analyse” fortæller ikke, hvilke data der skal bruges, hvem analysen er til, eller hvad der tæller som godt. Modellen udfylder hullerne selv, og det kan give et selvsikkert, men upræcist svar.
En anden fejl er at blande instruktion, baggrund og ønsket output i samme lange afsnit. Det gør det sværere at se, om modellen misforstår opgaven eller bare mangler information. Ved vigtige opgaver bør du formulere kravene eksplicit og bruge korte afsnit eller en enkel liste.
En tredje fejl er at bede modellen om sikker viden, når kilderne ikke rækker. En bedre instruktion beder modellen markere usikkerhed, skelne mellem dokumenterede fakta og vurderinger samt undlade at opfinde tal, datoer eller egenskaber. Det er især relevant ved tekniske emner, priser, regulering og tilgængelighed.
Hvordan påvirker modeltype og modalitet arbejdet?
Instruktioner virker forskelligt på tværs af modeller. En lille model kan have brug for mere eksplicit struktur, mens en nyere model kan forstå bredere formuleringer, men stadig have gavn af klare mål og test. Derfor bør en god instruktion ikke vurderes isoleret fra den model og den version, den bruges med.
Modalitet betyder også noget. Tekstmodeller arbejder med sprog, kode og dokumenter. Billedmodeller kræver beskrivelser af motiv, stil, komposition og begrænsninger. Multimodale modeller kan behandle tekst sammen med billeder, lyd eller andre datatyper, men det øger også behovet for tydelig afgrænsning.
En organisation bør derfor undgå at gøre én instruktion til en universel standard på tværs af alle systemer. En bedre praksis er at dokumentere, hvilken model, opgave, datakilde og evalueringsmetode instruktionen er testet med. Det gør senere ændringer mere overskuelige.
Hvor går grænsen mellem instruktion, data og værktøjer?
Grænsen er afgørende, når AI bruges i produktion. Instruktionen fortæller modellen, hvad den skal gøre. Data er det materiale, modellen skal forholde sig til. Værktøjer er funktioner uden for modellen, for eksempel databasesøgning, filadgang, kodekørsel eller handlinger i andre systemer.
Når grænserne bliver uklare, stiger risikoen for fejl. Hvis eksterne dokumenter indeholder tekst, der ligner en ordre til modellen, kan systemet komme til at behandle data som instruktion. Hvis modellen samtidig har adgang til værktøjer, kan en misforståelse få praktiske konsekvenser.
Det er netop her, instruktionsdesign møder arkitektur. I en enkel chat er konsekvensen ofte et dårligt svar. I en AI-agent kan samme svaghed påvirke handlinger, filer eller systemkald. Derfor hænger emnet sammen med forskellen mellem AI-agenter og AI-workflows.
Hvilke sikkerhedsrisici skal du tage alvorligt?
Den vigtigste sikkerhedsrisiko er, at input kan forsøge at ændre modellens adfærd på en måde, udvikleren ikke har ønsket. OWASP beskriver både direkte angreb fra brugerinput og indirekte angreb fra eksterne kilder som websider eller filer. Risikoen forsvinder ikke blot ved at bruge søgning, dokumenthentning eller finjustering.
Praktiske kontroller bør derfor ligge uden for selve modellen. Det kan være begrænsede rettigheder, godkendelse af følsomme handlinger, validering af outputformat og adskillelse mellem ubetroet indhold og systemregler. Modellen kan hjælpe med at opdage afvigelser, men den bør ikke være den eneste sikkerhedsbarriere.
Hvis en model skal bruges med kundedata, interne dokumenter eller automatiske handlinger, bør sikkerhed tænkes ind fra begyndelsen. En bredere gennemgang af kontroller findes i AI-sikkerhedsprotokoller og standarder, hvor adgang, test og styring er centrale temaer.
Hvordan kan en organisation gøre arbejdet gentageligt?
Gentagelighed kræver mere end gode formuleringer. Organisationen bør have ejerskab, versionsstyring, testeksempler og en enkel måde at rapportere fejl på. Ellers ender vigtige instruktioner som personlige noter hos enkelte medarbejdere, og kvaliteten bliver svær at fastholde.
En praktisk arbejdsgang kan begynde med en opgavebeskrivelse, fortsætte med et lille testsæt og slutte med godkendte versioner til konkrete brugssituationer. Når opgaven ændrer sig, ændres instruktionen og testsættet sammen. På den måde bliver ændringen synlig, i stedet for at den opstår tilfældigt i daglig brug.
- Definér opgaven og de fejl, der vil være kritiske.
- Saml fem til ti realistiske testinput.
- Skriv krav til format, kilder, usikkerhed og tone.
- Test output, ret instruktionen og gem versionen.
- Genbesøg versionen, når model, data eller arbejdsgang ændres.
For mindre teams kan en fælles mappe med godkendte instruktioner være nok. For større organisationer kan det kræve en egentlig proces med ansvarlige personer, adgangsstyring, logning og faste evalueringsintervaller.
Hvornår er teknikken ikke nok?
Teknikken er ikke nok, når opgaven kræver ny viden, domæneansvar, fortrolighed, retlige vurderinger eller handlinger med høj risiko. En præcis instruktion kan forbedre output, men den ændrer ikke modellens grundlæggende begrænsninger. Modellen kan stadig misforstå, udelade, generalisere for bredt eller lyde sikker uden at være det.
Ved kritiske beslutninger bør AI-output ses som et arbejdsmateriale, der kræver kontrol. Det gælder især ved sundhed, økonomi, ansættelse, sikkerhed, persondata, juridiske spørgsmål og tekniske ændringer i produktionssystemer. Her bør mennesker, tests og uafhængige datakilder indgå i processen.
En god tommelfingerregel er at spørge, hvad der sker, hvis modellen tager fejl. Hvis konsekvensen er lav, kan en veltestet instruktion være tilstrækkelig. Hvis konsekvensen er høj, skal instruktionen suppleres af kontrol, dokumentation, adgangsbegrænsning og menneskelig godkendelse.
Hvordan udvikler feltet sig?
Feltet bevæger sig fra enkeltstående smarte formuleringer mod mere systematisk styring af kontekst, værktøjer og evaluering. En omfattende survey fra 2024 beskriver et stort antal teknikker og begreber, hvilket viser, at disciplinen stadig er bred og terminologien ikke er fuldt stabiliseret.
Samtidig bliver modeller bedre til at forstå almindelige instruktioner. Det betyder ikke, at arbejdet forsvinder. Det flytter fokus fra at finde en særlig formulering til at designe gode opgaver, give relevant materiale, kontrollere output og integrere AI forsvarligt i arbejdsprocesser.
For brugere betyder udviklingen, at den mest værdifulde færdighed ofte er domæneklarhed: at vide, hvad der skal løses, hvilke data der må bruges, hvilke fejl der er acceptable, og hvordan et svar kan efterprøves. Det gør instruktionsdesign til en arbejdsmetode, ikke kun en sproglig teknik.
Hvilke kilder ligger til grund?
Artiklen bygger især på Google Clouds forklaring af modelinstruktioner, OpenAIs tekniske vejledning om styring af modeladfærd, OWASPs risikobeskrivelse for instruktionsangreb og forskningsoversigten fra Schulhoff m.fl..