Ordlista

Multimodal

En AI-modell som kan förstå och/eller generera flera olika typer av data, till exempel text, bild, ljud och video, i stället för bara en.

Multimodala modeller kan exempelvis analysera en bild och svara på frågor om den i text, eller kombinera text och ljud för att förstå en videos innehåll. Förmågan gör det möjligt att bygga betydligt mer flexibla AI-produkter, som att ladda upp ett foto och få det beskrivet eller analyserat. De flesta ledande stora språkmodeller, inklusive Claude, ChatGPT och Gemini, är i dag multimodala i olika utsträckning.

Simon Tern

Skrivet av

Simon Tern

Relaterade termer

Fler frågor om multimodal?

Jag hjälper er reda ut vad som faktiskt spelar roll för er verksamhet.

Prata med Simon →