L’IA multimodale désigne les systèmes d’IA capables de traiter et de générer plus d’un type de données — comme du texte, des images, de l’audio ou de la vidéo — au sein d’un seul modèle.
Les modèles multimodaux peuvent accepter et produire plusieurs types d’entrées et de sorties, permettant des tâches comme décrire une image en texte ou générer une image à partir d’une description textuelle.