Hvad er multimodal AI?
Multimodal AI er modeller der håndterer flere medietyper (tekst, billede og lyd) i samme samtale i stedet for kun tekst. Du kan vise modellen et foto, en tegning eller en lydoptagelse og få et svar der tager højde for det hele. For virksomheder er dokumentlæsning den mest almindelige gevinst: at fortolke og opsummere materiale der ikke er ren tekst.
Multimodal AI er modeller der kan håndtere flere forskellige medietyper i samme samtale: ikke kun tekst, men også billede og lyd. Du kan vise modellen et foto, indsætte et skærmbillede eller afspille en optagelse og få et svar der tager højde for alt det du har givet den. Ordet “modal” henviser netop til formen: Tekst er én modalitet, billede en anden, lyd en tredje.
Forskellen fra en ren tekstmodel er at materialet ikke først skal skrives om til tekst. Modellen tager det ind som det er, og ræsonnerer direkte om det. Det åbner for en række opgaver der tidligere krævede at et menneske sad imellem og oversatte indholdet til ord.
Konkrete eksempler fra erhvervslivet
Det abstrakte bliver tydeligt med eksempler. Her er tre opgaver som en multimodal model kan påtage sig, men som en ren tekstmodel ikke kan klare:
- Læse et billede af et beskadiget produkt. En kunde fotograferer en ødelagt vare. Modellen kan beskrive hvad der ses, og foreslå næste skridt i en sag uden at nogen behøver at beskrive billedet med ord.
- Fortolke en tegning. En teknisk skitse eller en plantegning kan læses og opsummeres, og spørgsmål om indholdet besvares direkte ud fra billedet.
- Transskribere et møde. En lydoptagelse bliver til tekst, og modellen kan desuden trække beslutninger og handlingspunkter ud af samtalen i stedet for bare at gengive ordene.
Fællesnævneren er at input ikke er ren tekst. Netop dér, i springet fra billede og lyd til et brugbart resultat, ligger den multimodale værdi.
Sådan adskiller det sig fra en kæde af specialmodeller
Man kan løse lignende opgaver ved at kæde flere specialmodeller sammen: Én model omsætter billedet til tekst, en anden tager teksten og svarer. Det virker, men har en svaghed: Information går tabt ved hver overlevering, og kæden bliver sårbar over for fejl i de tidlige led.
| Tilgang | Kendetegn |
|---|---|
| Multimodal model | Tager alt ind på én gang og vejer billede mod tekst i ét ræsonnement |
| Kæde af specialmodeller | Trin for trin, og information kan gå tabt mellem leddene |
En multimodal model tager i stedet billede og tekst ind samtidig og kan veje dem mod hinanden i ét og samme ræsonnement. Det giver færre fejlkilder og et svar der hænger bedre sammen. Kæden kan dog nogle gange være det rigtige valg, f.eks. når hvert trin skal styres og kontrolleres separat, men til blandet materiale er den samlede model ofte både enklere og mere pålidelig.
Et konkret scenarie
Lad os sige at I modtager skadesanmeldelser med fotos og en kort beskrivelse. I dag læser en sagsbehandler hver sag manuelt. Med en multimodal løsning kan modellen tage både billedet og teksten, foreslå en klassificering af skaden og opsummere sagen så sagsbehandleren går fra at læse alt til at gennemgå et færdigt udkast. Arbejdet forsvinder ikke, men tyngdepunktet flytter sig fra indlæsning til vurdering, og kontrollen bliver hos et menneske.
Hvor gevinsten er størst
Hvis man skal udpege den mest almindelige gevinst for virksomheder, er det dokumentlæsning. Meget af det en virksomhed håndterer, er ikke ren tekst, men fakturaer, blanketter, scannede kontrakter og skærmbilleder. At lade en model læse den slags materiale og trække det relevante ud sparer manuelt arbejde i stor skala, og det er ofte her værdien er nemmest at regne hjem.
Almindelige faldgruber du skal kende
Multimodal AI er kraftfuldt, men det er værd at gå ind til det med de rigtige forventninger. To ting går igen.
Den første er usikker læsning af svært materiale. Håndskrevet tekst, slørede fotos og rodede blanketter fortolkes med lavere sikkerhed end ren, trykt tekst. I flows hvor tal og beløb betyder noget, bør resultatet derfor kontrolleres af et menneske: Behandl modellens fortolkning som et udkast, ikke som en færdig sandhed.
Den anden er at vælge multimodalt uden grund. Består alt jeres materiale allerede af tekst, tilfører en multimodal model ingen ekstra værdi og kan koste mere. Gevinsten opstår først når materialet faktisk indeholder billede eller lyd. Tag derfor udgangspunkt i jeres faktiske arbejdsgange snarere end i hvad teknikken kan i teorien.
Vil du vide om jeres arbejdsgange egner sig til en multimodal løsning, kan du læse mere om vores AI-ydelser eller kontakte os med en beskrivelse af hvilket materiale I arbejder med i dag.
Ofte stillede spørgsmål
Hvilke medietyper kan multimodal AI håndtere?
Oftest tekst, billede og lyd i forskellige kombinationer. En model kan læse og skrive tekst, fortolke indholdet i et foto eller et skærmbillede og transskribere eller ræsonnere om en lydoptagelse. Nogle modeller håndterer også video. Hvilke typer der understøttes, varierer mellem modeller, så det er værd at holde det op mod det I faktisk har brug for.
Hvordan adskiller det sig fra at kæde separate specialmodeller sammen?
I en kæde sendes resultatet fra én model videre til den næste (billede til tekst, tekst til svar), og der går information tabt ved hvert trin. En multimodal model tager alt ind på én gang og kan veje billede mod tekst i ét og samme ræsonnement. Det giver ofte færre fejlkilder og et svar der hænger bedre sammen, men kæden kan stadig være det rigtige valg når trinene skal styres hver for sig.
Hvad er den mest almindelige gevinst ved multimodal AI for virksomheder?
Dokumentlæsning. Meget af det virksomheder håndterer, er ikke ren tekst, men fakturaer, blanketter, tegninger, skærmbilleder og scannede kontrakter. En multimodal model kan læse den slags materiale og udtrække det der er brug for, hvilket sparer manuelt arbejde. Det er ofte her værdien bliver tydeligst og nemmest at regne hjem.
Kan multimodal AI læse håndskrevet tekst?
Ofte ja, men med lavere sikkerhed end trykt tekst. Kvaliteten afhænger af håndskriften, billedets skarphed og hvor ustruktureret materialet er. I forretningskritiske flows bør resultatet derfor kontrolleres, især når tal og beløb er involveret. Behandl det som et udkast som et menneske bekræfter, ikke som en færdig sandhed.
Har vi brug for en multimodal model til vores AI-løsning?
Det afhænger af materialet. Består alt jeres materiale allerede af tekst, kommer I langt med en tekstmodel. Først når I skal fortolke billeder, lyd eller blandet materiale, tilfører det multimodale noget konkret. Tag udgangspunkt i jeres faktiske arbejdsgange snarere end i hvad teknikken kan i teorien, så bliver valget enklere og løsningen billigere.