Hva er multimodal AI?
Multimodal AI er modeller som håndterer flere medietyper, som tekst, bilde og lyd, i samme samtale i stedet for bare tekst. Du kan vise modellen et foto, en tegning eller et lydopptak og få et svar som tar hensyn til alt. For virksomheter er lesing av dokumenter den vanligste nytten: å tolke og oppsummere materiale som ikke er ren tekst.
Multimodal AI er modeller som takler flere ulike medietyper i samme samtale, ikke bare tekst, men også bilde og lyd. Du kan vise modellen et foto, lime inn et skjermbilde eller spille av et opptak og få et svar som tar hensyn til alt du har gitt den. Ordet «modal» viser nettopp til formen: Tekst er én modalitet, bilde en annen og lyd en tredje.
Det som skiller den fra en ren tekstmodell, er at materialet ikke trenger å skrives om til tekst først. Modellen tar det inn som det er, og resonnerer rundt det direkte. Det åpner for en rekke oppgaver som tidligere krevde at et menneske satt imellom og oversatte innholdet til ord.
Konkrete eksempler fra næringslivet
Det abstrakte blir tydelig med eksempler. Her er tre oppgaver en multimodal modell kan ta seg av, og som en ren tekstmodell ikke kan:
- Lese et bilde av et skadet produkt. En kunde tar bilde av en ødelagt vare. Modellen kan beskrive det som vises, og foreslå neste steg i en sak, uten at noen trenger å beskrive bildet med ord.
- Tolke en tegning. En teknisk skisse eller en plantegning kan leses og oppsummeres, og spørsmål om innholdet besvares direkte ut fra bildet.
- Transkribere et møte. Et lydopptak blir til tekst, og modellen kan i tillegg trekke frem beslutninger og tiltak fra samtalen i stedet for bare å gjengi ordene.
Fellesnevneren er at inndataene ikke er ren tekst. Nettopp der, i steget fra bilde og lyd til et brukbart resultat, ligger den multimodale verdien.
Multimodal modell kontra en kjede av spesialmodeller
Man kan løse lignende oppgaver ved å kjede sammen flere spesialmodeller: Én modell gjør bildet om til tekst, en annen tar teksten og svarer. Det fungerer, men har en svakhet. Informasjon går tapt ved hver overlevering, og kjeden blir sårbar for feil i de tidlige leddene.
| Tilnærming | Kjennetegn |
|---|---|
| Multimodal modell | Tar inn alt samtidig og veier bilde mot tekst i ett resonnement |
| Kjede av spesialmodeller | Steg for steg, og informasjon kan gå tapt mellom leddene |
En multimodal modell tar i stedet inn bilde og tekst samtidig og kan veie dem mot hverandre i ett og samme resonnement. Det gir færre feilkilder og et svar som henger bedre sammen. Kjeden kan likevel være det riktige valget iblant, for eksempel når hvert steg må styres og kontrolleres separat, men for blandet materiale er den samlede modellen ofte både enklere og mer pålitelig.
Et konkret scenario
La oss si at dere tar imot skademeldinger med bilder og en kort beskrivelse. I dag leser en saksbehandler hver sak manuelt. Med en multimodal løsning kan modellen ta inn både bildet og teksten, foreslå en klassifisering av skaden og oppsummere saken slik at saksbehandleren går fra å lese alt til å gå gjennom et ferdig utkast. Arbeidet forsvinner ikke, men tyngdepunktet flyttes fra innlesing til vurdering, og kontrollen ligger fortsatt hos et menneske.
Der nytten er størst
Skal man peke ut den aller vanligste nytten for virksomheter, er det lesing av dokumenter. Mye av det en virksomhet håndterer, er ikke ren tekst, men fakturaer, skjemaer, skannede avtaler og skjermbilder. Å la en modell lese slikt materiale og hente ut det relevante sparer manuelt arbeid i stor skala, og det er ofte her det er enklest å regne ut verdien.
Vanlige fallgruver å kjenne til
Multimodal AI er kraftfull, men det er verdt å gå inn med de riktige forventningene. To ting går igjen.
Den første er usikker lesing av vanskelig materiale. Håndskrevet tekst, uskarpe bilder og rotete skjemaer tolkes med lavere sikkerhet enn ren, trykt tekst. I arbeidsflyter der tall og beløp betyr noe, bør resultatet derfor kontrolleres av et menneske. Behandle modellens tolkning som et utkast, ikke som en ferdig sannhet.
Den andre er å velge multimodalt uten grunn. Er alt dere jobber med, allerede tekst, tilfører en multimodal modell ingen ekstra verdi og kan koste mer. Nytten oppstår først når materialet faktisk inneholder bilde eller lyd. Ta derfor utgangspunkt i de virkelige arbeidsflytene deres snarere enn i hva teknologien kan i teorien.
Vil du vite om arbeidsflytene deres egner seg for en multimodal løsning, kan du lese mer om AI-tjenestene våre eller ta kontakt med en beskrivelse av hvilket materiale dere jobber med i dag.
Ofte stilte spørsmål
Hvilke medietyper kan multimodal AI håndtere?
Vanligst er tekst, bilde og lyd i ulike kombinasjoner. En modell kan lese og skrive tekst, tolke innholdet i et foto eller et skjermbilde og transkribere eller resonnere rundt et lydopptak. Noen modeller håndterer også video. Hvilke typer som støttes, varierer mellom modellene, så det er verdt å sjekke mot det dere faktisk trenger.
Hva skiller multimodal AI fra en kjede av separate spesialmodeller?
I en kjede sendes resultatet fra én modell videre til den neste, fra bilde til tekst og fra tekst til svar, og informasjon går tapt i hvert steg. En multimodal modell tar inn alt samtidig og kan veie bilde mot tekst i ett og samme resonnement. Det gir ofte færre feilkilder og et svar som henger bedre sammen, men kjeden kan likevel være riktig når stegene må styres hver for seg.
Hva er den vanligste nytten av multimodal AI for virksomheter?
Lesing av dokumenter. Mye av det virksomheter håndterer, er ikke ren tekst, men fakturaer, skjemaer, tegninger, skjermbilder og skannede avtaler. En multimodal modell kan lese slikt materiale og hente ut det som trengs, og det sparer manuelt arbeid. Det er ofte her verdien blir tydeligst og enklest å regne på.
Kan multimodal AI lese håndskrevet tekst?
Ofte ja, men med lavere sikkerhet enn trykt tekst. Kvaliteten avhenger av håndskriften, hvor skarpt bildet er og hvor ustrukturert materialet er. I virksomhetskritiske arbeidsflyter bør resultatet derfor kontrolleres, særlig når tall og beløp er involvert. Behandle det som et utkast som et menneske bekrefter, ikke som en ferdig sannhet.
Trenger vi en multimodal modell i AI-løsningen vår?
Det avhenger av materialet. Er alt dere jobber med, allerede tekst, kommer dere langt med en tekstmodell. Først når dere må tolke bilder, lyd eller blandet materiale, tilfører det multimodale noe konkret. Ta utgangspunkt i de faktiske arbeidsflytene deres snarere enn i hva teknologien kan i teorien, så blir valget enklere og løsningen billigere.