Hvad er AI-hallucinationer?

Af Weapp · Opdateret

AI-hallucinationer er når en sprogmodel leverer opdigtet information i en selvsikker tone: et citat, en kilde eller et tal der lyder rigtigt, men ikke passer. Det er en indbygget egenskab og ikke en bug: Modellen forudsiger sandsynlig tekst snarere end sandhed. De vigtigste modtræk er RAG med kilder og menneskelig kontrol.

En AI-hallucination er når en sprogmodel siger noget der simpelthen ikke passer, men gør det med fuld selvsikkerhed. Det kan være et opdigtet citat, en kilde der ikke findes, eller et tal der lyder rimeligt, men er forkert. At forstå hvorfor det sker, er afgørende for at kunne bruge AI ansvarligt, for det er ikke en fejl man kan vente sig ud af.

Hvorfor det sker

Nøglen til at forstå hallucinationer ligger i hvad en sprogmodel faktisk gør. Den slår ikke fakta op i en database. Den forudsiger det næste ord, igen og igen, ud fra mønstre i de enorme tekstmængder den er trænet på. Målet er tekst der er statistisk sandsynlig, ikke tekst der er sand.

For det meste falder de to ting sammen: Den mest sandsynlige fortsættelse er også den korrekte. Men nogle gange er den mest rimeligt klingende formulering forkert, og så produceres fejlen lige så flydende og overbevisende som et rigtigt svar. Modellen “ved” ikke at den tager fejl, for den har ingen indbygget forestilling om sandhed at kontrollere mod.

Derfor forstås hallucination bedst som en indbygget egenskab, ikke en bug. Det er ikke noget en linje kode kan patche væk. Nyere og bedre modeller hallucinerer sjældnere, men fænomenet er en følge af hvordan teknologien fungerer og forsvinder ikke helt.

Sådan ser en hallucination ud

Det lumske ved hallucinationer er netop at de ikke ligner fejl. Her er de mest almindelige typer man bør kunne genkende:

  • Opdigtede kilder. Modellen henviser til en bog, en undersøgelse eller en paragraf der ser helt troværdig ud, men ikke eksisterer.
  • Forkerte tal. Priser, datoer, mål eller statistik der lyder rimelige, men er grebet ud af luften.
  • Opfundne detaljer. Navne, funktioner eller begivenheder der fylder et svar ud hvor modellen i virkeligheden ikke har noget grundlag.

Fælles for dem er tonen. Alt leveres med samme selvsikkerhed, og derfor er en fejl let at overse hvis man ikke tjekker efter. En model siger sjældent “det her er jeg usikker på” af sig selv.

De to vigtigste modtræk

Kan man så stole på AI? Ja, forudsat at man bygger beskyttelse ind der matcher hvor følsomt flowet er. To modtræk rækker længst.

Det første er RAG, retrieval-augmented generation. I stedet for at lade modellen svare ud fra hukommelsen lader man den først hente relevante dokumenter fra en pålidelig kilde og derefter formulere svaret ud fra dem. Så er svaret forankret i virkelig tekst som man kan pege på, og det både mindsker risikoen for opdigtede svar og gør svaret sporbart til en kilde.

Det andet er menneskelig kontrol i kritiske flows. Overalt hvor en fejl får konsekvenser (i aftaler, økonomi, medicinsk eller juridisk information), skal et menneske kontrollere svaret før det bruges. Et konkret eksempel: En intern assistent der svarer på spørgsmål fra personalehåndbogen, bør vise hvilket afsnit svaret kommer fra så en medarbejder hurtigt kan verificere at det passer.

Pointen er ikke at undgå AI fordi den nogle gange tager fejl, men at designe rundt om egenskaben. Kombinationen af kildeforankrede svar og menneskelig kontrol flytter teknologien fra gæt til noget man kan bygge en forretning på.

Risikoen er forskellig i forskellige flows

En sidste vigtig nuance: Hvor meget en hallucination betyder, afhænger helt af sammenhængen. Beder du en model om idéer til en overskrift, spiller en fejl ingen rolle, for du sorterer alligevel i forslagene. Beder du den om en paragraf i en aftale eller et medicinsk råd, kan den samme type fejl få alvorlige følger.

Derfor skal kontrolniveauet matche det der står på spil. I kreative og udforskende flows kan man give modellen frie tøjler. I flows hvor fejl koster penge, tillid eller sikkerhed, skal både kildeforankring og menneskelig kontrol være på plads. At inddele sine flows efter hvor følsomme de er, og lægge kontrollerne hvor der er brug for dem, er kernen i at bruge AI ansvarligt. Vil du vide mere om hvordan vi bygger pålidelige AI-løsninger, kan du læse om vores arbejde med AI eller kontakte os.

Ofte stillede spørgsmål

Hvorfor finder en AI på ting?

Fordi en sprogmodel ikke slår fakta op: Den forudsiger det næste ord ud fra mønstre i det den er trænet på. Målet er tekst der er statistisk sandsynlig, ikke tekst der er sand. Oftest falder de to sammen, men nogle gange er den mest sandsynlige formulering simpelthen forkert, og så lyder fejlen lige så sikker som et korrekt svar.

Er hallucinationer en bug der kan rettes?

Nej, det er en indbygget egenskab ved den måde modellerne fungerer på, ikke en fejl i koden der kan patches væk. Nyere modeller hallucinerer mindre, men fænomenet forsvinder ikke helt. Derfor handler praktisk håndtering om at bygge beskyttelse rundt om modellen snarere end at vente på en version der aldrig tager fejl.

Hvad er et typisk eksempel på en hallucination?

Opdigtede kilder og tal er klassikere. Modellen kan henvise til en bog, en rapport eller en paragraf der ser troværdig ud, men ikke findes, eller angive en pris eller en dato der lyder rimelig, men er forkert. Det lumske er tonen: Fejlen præsenteres med samme selvsikkerhed som et korrekt svar.

Hvordan mindsker man risikoen for hallucinationer?

To modtræk rækker længst. RAG lader modellen først hente relevante dokumenter og svare ud fra dem så svaret er forankret i virkelig tekst i stedet for i hukommelsen. Menneskelig kontrol i kritiske flows fanger det der alligevel slipper igennem. Tilsammen flytter de svarene fra gæt til noget der er underbygget.

Kan man stole på AI når den hallucinerer?

Ja, hvis man bruger den rigtigt. AI er fremragende som hjælp og til udkast, men i flows hvor fejl får konsekvenser, skal svarene kunne kontrolleres mod en kilde og gennemgås af et menneske. Pointen er ikke at undgå teknologien, men at bygge kontroller ind der matcher hvor følsomt det enkelte flow er.