Hva er guardrails?

Av Weapp · Oppdatert

Guardrails (direkte oversatt «autovern») er de tekniske sperrene som begrenser hva en AI-løsning får lese, si og gjøre. De virker i tre lag: filtrere inndata, styre modellens atferd og kontrollere utdata før de når brukeren. Eksempler er temasperrer, maskering av personopplysninger og maksbeløp for agenthandlinger. Guardrails supplerer tilgangsstyring, men erstatter den aldri.

Guardrails er de tekniske sperrene som begrenser hva en AI-løsning får lese, si og gjøre. Ordet betyr nettopp autovern, og bildet er treffende: Autovernet hindrer ikke bilen i å kjøre, men det holder den på veien. På samme måte hindrer ikke guardrails AI-løsningen i å være nyttig. De sørger for at den holder seg innenfor det den skal.

En generell modell kan i prinsippet svare på hva som helst, i hvilken som helst tone. For en virksomhet er det sjelden ønskelig. Guardrails er det som gjør en formbar modell til en tjeneste man tør å slippe løs på ekte brukere og ekte data.

De tre lagene

Guardrails bygges ikke som én enkelt sperre, men i tre lag som griper inn på ulike steder i flyten.

  • Filtrere inndata. Før et spørsmål i det hele tatt når modellen, kan det kontrolleres og stoppes hvis det er upassende eller farlig. Her stoppes for eksempel åpenbare forsøk på å misbruke tjenesten.
  • Styre atferd. Gjennom instruksjoner og regler holdes modellen innenfor oppdraget sitt: hvilken rolle den har, hvilke temaer den skal unngå og hvordan den skal svare.
  • Kontrollere utdata. Før svaret når brukeren, kan det sjekkes. Har modellen ved et uhell fått med en personopplysning eller formulert noe upassende, kan det fanges opp i dette siste steget.

Poenget med tre lag er at ikke noe enkelt lag er helt pålitelig. Det som slipper forbi filteret, bør helst fanges opp av kontrollen. Dybden er vernet.

Konkrete eksempler

Det abstrakte blir tydeligere med eksempler fra virkeligheten på hva guardrails gjør i praksis.

GuardrailHva den gjør
TemasperreHolder en kundeservicebot unna for eksempel medisinske råd
PII-maskeringSkjuler personopplysninger slik at de aldri vises i klartekst
Maksbeløp for agentKrever menneskelig godkjenning over en viss sum

En temasperre sørger for at en bot avstår fra spørsmål den ikke skal besvare. Maskering av personopplysninger gjør at sensitive felt aldri kommer frem i klartekst. Et maksbeløp hindrer en agent i å godkjenne en transaksjon over en viss grense på egen hånd. Felles for dem alle er at de setter en tydelig, teknisk grense for hva løsningen får gjøre, ikke bare et håp om at den skal oppføre seg.

Verdt å merke seg er at en guardrail skal være nettopp en teknisk regel, ikke bare en instruksjon i systemprompten. En instruksjon om å «aldri gi medisinske råd» kan påvirkes av uheldig formulerte inndata, mens en ekte sperre sitter utenfor modellen og er vanskeligere å snakke seg forbi. Forskjellen mellom et håp og en sperre er akkurat den: Et håp kan modellen svikte, en sperre kan den ikke omgå like lett.

Guardrails erstatter aldri tilgangsstyring

Her går det et avgjørende skille. Guardrails styrer hvordan AI-løsningen oppfører seg, men de avgjør ikke hva som i bunn og grunn er tilgjengelig. Det gjør tilgangsstyringen, som bestemmer hvilke data og hvilke systemer en bruker eller tjeneste i det hele tatt har rett til å nå.

Forskjellen betyr noe. En guardrail kan hindre modellen i å vise en sensitiv opplysning i et svar. Men hvis tilgangene er feil satt og opplysningen egentlig ikke burde vært tilgjengelig i det hele tatt, er grunnproblemet der fortsatt. Guardrailen skjuler bare symptomet. Ekte sikkerhet begynner derfor i tilgangene, og guardrails legges oppå som et supplerende vern. Å forveksle de to er en vanlig og farlig feil.

En måte å holde dem fra hverandre på: Tilgangsstyringen bestemmer hva som finnes bak døren, guardrails bestemmer hvordan den som allerede er inne, får oppføre seg. Begge trengs, men i feil rekkefølge blir vernet bare tilsynelatende. En AI-løsning som stoler på guardrails for å kompensere for slappe tilganger, står og faller med at hver enkelt sperre holder, og det er et svakt grunnlag å bygge på. Sett tilgangene først, og la guardrails finjustere heller enn erstatte.

Hva det betyr for deg som kjøper

For deg som kjøper en AI-løsning, er guardrails en av delene som avgjør om tjenesten er til å stole på i produksjon. En løsning uten sperrer kan svare upassende, lekke opplysninger eller handle utenfor oppdraget sitt, og det skal bare én hendelse til for å skade tilliten.

Hvor omfattende vernet må være, avhenger av hva tjenesten gjør og hvilke data den berører. Vi i Weapp bygger guardrails som en del av løsningen fra starten, ikke som noe som legges til i etterkant. Vil du drøfte hvilke sperrer en tjeneste hos dere ville trenge, kan du lese mer om AI-tjenestene våre eller ta kontakt med en beskrivelse av hva tjenesten skal gjøre.

Ofte stilte spørsmål

Hvilke tre lag består guardrails av?

Først filtrering av inndata: å fange opp og stoppe upassende eller farlige spørsmål før de når modellen. Deretter styring av atferd: å holde modellen innenfor oppdraget sitt gjennom instruksjoner og regler. Til slutt kontroll av utdata: å sjekke svaret før det når brukeren, for eksempel for å fange opp personopplysninger som har lekket. Sammen utgjør de tre lagene et vern som ikke avhenger av ett enkelt punkt.

Hva er et konkret eksempel på en guardrail?

En temasperre som gjør at en kundeservicebot avstår fra medisinske råd, er en guardrail. Andre eksempler er maskering av personopplysninger slik at sensitive felt aldri vises i klartekst, og et maksbeløp som hindrer en agent i å godkjenne transaksjoner over en viss sum uten menneskelig godkjenning. Felles for dem er at de setter tydelige grenser for hva løsningen får gjøre.

Er guardrails det samme som tilgangsstyring?

Nei, og forskjellen er viktig. Tilgangsstyring avgjør hva en bruker eller et system i det hele tatt har rett til å få tilgang til. Guardrails styrer hvordan AI-løsningen oppfører seg innenfor de rammene. En guardrail kan hindre modellen i å vise en opplysning, men hvis tilgangene er feil satt og dataene er tilgjengelige, er grunnproblemet der fortsatt. Guardrails supplerer tilgangsstyring, de erstatter den ikke.

Kan guardrails omgås?

Ikke noe enkelt lag er helt pålitelig, og det er nettopp grunnen til at guardrails bygges i flere lag. Et ondsinnet spørsmål kan av og til slippe forbi et filter, men blir da forhåpentligvis fanget opp av kontrollen av utdata. Tanken er å gjøre det vanskelig å komme forbi alt på én gang, ikke å stole på én enkelt sperre. Dybden i lagene er vernet.

Trenger alle AI-løsninger guardrails?

I praksis ja, hvis løsningen møter brukere eller håndterer sensitiv informasjon. Uten sperrer blir en AI-tjeneste vanskelig å stole på i produksjon fordi den kan svare upassende eller lekke opplysninger. Hvor omfattende vernet må være, avhenger av hva tjenesten gjør og hvilke data den berører, men en eller annen form for guardrails hører med til grunnmuren i en gjennomtenkt løsning.