Hvad er guardrails?
Guardrails er de tekniske autoværn der begrænser hvad en AI-løsning må læse, sige og gøre. De virker i tre lag: filtrering af input, styring af modellens adfærd og kontrol af output før det når brugeren. Eksempler er emnespærringer, maskering af personoplysninger og beløbsgrænser for agenthandlinger. Guardrails supplerer adgangsstyring, men erstatter den aldrig.
Guardrails er de tekniske autoværn der begrænser hvad en AI-løsning må læse, sige og gøre. Ordet betyder netop autoværn, og billedet er rammende: Autoværnet forhindrer ikke bilen i at køre, men det holder den på vejen. På samme måde forhindrer guardrails ikke AI-løsningen i at være nyttig. De sørger for at den holder sig inden for det den skal.
En generel model kan i princippet svare på hvad som helst, i hvilken som helst tone. For en virksomhed er det sjældent ønskværdigt. Guardrails er det der gør en formbar model til en tjeneste man tør slippe løs på rigtige brugere og rigtige data.
De tre lag
Guardrails bygges ikke som én enkelt spærring, men i tre lag der griber ind forskellige steder i flowet.
- Filtrering af input. Før et spørgsmål overhovedet når modellen, kan det kontrolleres og stoppes hvis det er upassende eller farligt. Her fanges f.eks. åbenlyse forsøg på at misbruge tjenesten.
- Styring af adfærd. Gennem instruktioner og regler holdes modellen inden for sin opgave: hvilken rolle den har, hvilke emner den skal undgå, og hvordan den skal svare.
- Kontrol af output. Før svaret når brugeren, kan det kontrolleres. Har modellen ved et uheld fået en personoplysning med eller formuleret noget upassende, kan det fanges i dette sidste trin.
Pointen med tre lag er at intet enkelt lag er fuldstændig pålideligt. Det der slipper forbi filteret, skal helst fanges af kontrollen. Dybden er beskyttelsen.
Konkrete eksempler
Det abstrakte bliver tydeligt med virkelige eksempler på hvad guardrails gør i praksis.
| Guardrail | Hvad den gør |
|---|---|
| Emnespærring | Holder en kundeservicebot væk fra f.eks. medicinske råd |
| PII-maskering | Skjuler personoplysninger så de aldrig vises i klartekst |
| Beløbsgrænse for agent | Kræver menneskelig godkendelse over et vist beløb |
En emnespærring sørger for at en bot afstår fra spørgsmål den ikke skal besvare. Maskering af personoplysninger betyder at følsomme felter aldrig når frem i klartekst. En beløbsgrænse forhindrer en agent i på egen hånd at godkende en transaktion over en vis grænse. Fælles for dem alle er at de sætter en klar, teknisk grænse for hvad løsningen må gøre, ikke bare et håb om at den opfører sig ordentligt.
Det er værd at bemærke at en guardrail skal være netop en teknisk regel, ikke kun en instruktion i systemprompten. En instruktion om “aldrig at give medicinske råd” kan påvirkes af dårligt formuleret input mens en rigtig spærring sidder uden for modellen og er sværere at snakke sig forbi. Forskellen mellem et håb og en spærring er præcis den: Et håb kan modellen svigte, en spærring kan den ikke omgå lige så let.
Guardrails erstatter aldrig adgangsstyring
Her er der en afgørende grænsedragning. Guardrails styrer hvordan AI-løsningen opfører sig, men de afgør ikke hvad der grundlæggende er tilgængeligt. Det gør adgangsstyringen: Den bestemmer hvilke data og hvilke systemer en bruger eller tjeneste overhovedet har ret til at nå.
Forskellen betyder noget. En guardrail kan forhindre modellen i at vise en følsom oplysning i et svar. Men hvis rettighederne er sat forkert og oplysningen egentlig slet ikke burde være tilgængelig, består grundproblemet. Guardrailen skjuler kun symptomet. Rigtig sikkerhed begynder derfor i rettighederne, og guardrails lægges ovenpå som en supplerende beskyttelse. At forveksle de to er en almindelig og farlig fejl.
En måde at holde dem adskilt på: Adgangsstyringen bestemmer hvad der er bag døren, guardrails bestemmer hvordan den der allerede er inde, må opføre sig. Begge dele er nødvendige, men i den forkerte rækkefølge bliver beskyttelsen kun tilsyneladende. En AI-løsning der er afhængig af guardrails for at kompensere for slappe rettigheder, står og falder med at hver enkelt spærring holder, og det er et svagt grundlag at bygge på. Sæt rettighederne først, og lad guardrails forfine snarere end erstatte.
Hvad det betyder for dig som kunde
For dig der køber en AI-løsning, er guardrails en af de dele der afgør om tjenesten er til at stole på i produktion. En løsning uden autoværn kan svare upassende, lække oplysninger eller handle uden for sin opgave, og der skal kun én hændelse til for at skade tilliden.
Hvor omfattende beskyttelsen skal være, afhænger af hvad tjenesten gør og hvilke data den berører. Hos Weapp bygger vi guardrails ind som en del af løsningen fra begyndelsen, ikke som noget der lægges til bagefter. Vil du drøfte hvilke autoværn en tjeneste hos jer ville have brug for, kan du læse mere om vores AI-ydelser eller kontakte os med en beskrivelse af hvad tjenesten skal gøre.
Ofte stillede spørgsmål
Hvilke tre lag består guardrails af?
Først filtrering af input: at fange og stoppe upassende eller farlige spørgsmål før de når modellen. Dernæst styring af adfærd: at holde modellen inden for sin opgave via instruktioner og regler. Til sidst kontrol af output: at tjekke svaret før det når brugeren, f.eks. for at fange lækkede personoplysninger. Sammen danner de tre lag en beskyttelse der ikke afhænger af et enkelt punkt.
Hvad er et konkret eksempel på en guardrail?
En emnespærring der får en kundeservicebot til at afstå fra at give medicinske råd, er en guardrail. Andre eksempler er maskering af personoplysninger så følsomme felter aldrig vises i klartekst, og en beløbsgrænse der forhindrer en agent i at godkende transaktioner over en bestemt sum uden menneskelig godkendelse. Fælles for dem er at de sætter klare grænser for hvad løsningen må gøre.
Er guardrails det samme som adgangsstyring?
Nej, og forskellen er vigtig. Adgangsstyring afgør hvad en bruger eller et system overhovedet har ret til at tilgå. Guardrails styrer hvordan AI-løsningen opfører sig inden for de rammer. En guardrail kan forhindre modellen i at vise en oplysning, men hvis rettighederne er sat forkert og dataene er tilgængelige, består grundproblemet. Guardrails supplerer adgangsstyring, de erstatter den ikke.
Kan guardrails omgås?
Intet enkelt lag er fuldstændig pålideligt, og det er netop grunden til at guardrails bygges i flere lag. Et ondsindet spørgsmål kan nogle gange slippe forbi et filter, men bliver så forhåbentlig fanget af kontrollen af output. Tanken er at gøre det svært at komme forbi det hele på én gang, ikke at stole på en enkelt spærring. Dybden i lagene er beskyttelsen.
Har alle AI-løsninger brug for guardrails?
I praksis ja hvis løsningen møder brugere eller håndterer følsomme oplysninger. Uden autoværn bliver en AI-tjeneste svær at stole på i produktion fordi den kan svare upassende eller lække oplysninger. Hvor omfattende beskyttelsen skal være, afhænger af hvad tjenesten gør og hvilke data den berører, men en eller anden form for guardrails hører til grundlaget i en gennemtænkt løsning.