Multimodale AI
Een multimodale AI is een systeem dat verschillende soorten informatie — tekst, beelden, audio, video — binnen één model kan verwerken en combineren, in plaats van slechts één modaliteit te behandelen. Daardoor kun je het bijvoorbeeld een foto tonen en erover vragen stellen, een grafiek laten beschrijven, een video laten samenvatten of een beeld laten genereren vanuit een zin. Het is een belangrijke stap naar nuttigere en natuurlijkere assistenten, want mensen communiceren ook door woorden, beelden en geluiden te mengen. De nieuwste modellen van de grote aanbieders zijn standaard multimodaal. Het verbreedt de toepassingen sterk — toegankelijkheid, onderwijs, documenten met beelden analyseren — al erft het dezelfde betrouwbaarheidsgrenzen als de rest van generatieve AI.