Ordlista
Multimodal
En AI-modell som kan förstå och/eller generera flera olika typer av data, till exempel text, bild, ljud och video, i stället för bara en.
Multimodala modeller kan exempelvis analysera en bild och svara på frågor om den i text, eller kombinera text och ljud för att förstå en videos innehåll. Förmågan gör det möjligt att bygga betydligt mer flexibla AI-produkter, som att ladda upp ett foto och få det beskrivet eller analyserat. De flesta ledande stora språkmodeller, inklusive Claude, ChatGPT och Gemini, är i dag multimodala i olika utsträckning.

Skrivet av
Simon TernRelaterade termer
AI-modell
Ett datorprogram tränat på data för att känna igen mönster och utföra en specifik uppgift, som att generera text, klassificera bilder eller göra förutsägelser.
Generativ AI
AI-modeller som skapar nytt innehåll, som text, bild, ljud eller video, snarare än att bara analysera eller klassificera befintlig data.
LLM
Large language model, en stor AI-modell tränad på enorma mängder text för att förstå och generera språk.
Fler frågor om multimodal?
Jag hjälper er reda ut vad som faktiskt spelar roll för er verksamhet.
Prata med Simon →