IA multimodale

Une IA multimodale est un système capable de traiter et de combiner différents types d'information — texte, images, audio, vidéo — au sein d'un même modèle, au lieu de ne gérer qu'une seule modalité. Grâce à cela, vous pouvez par exemple lui montrer une photo et lui poser des questions à son sujet, lui demander de décrire un graphique, de résumer une vidéo ou de générer une image à partir d'une phrase. C'est une étape importante vers des assistants plus utiles et plus naturels, car les humains aussi communiquent en mêlant mots, images et sons. Les modèles les plus récents des grands fournisseurs sont multimodaux par défaut. Cela élargit fortement les cas d'usage — accessibilité, éducation, analyse de documents comportant des images — mais hérite des mêmes limites de fiabilité que le reste de l'IA générative.