Multimodale KI
Eine multimodale KI ist ein System, das verschiedene Arten von Information – Text, Bilder, Audio, Video – innerhalb eines einzigen Modells verarbeiten und verbinden kann, statt nur eine Modalität zu handhaben. Dadurch kannst du ihr etwa ein Foto zeigen und dazu Fragen stellen, sie eine Grafik beschreiben, ein Video zusammenfassen oder aus einem Satz ein Bild erzeugen lassen. Es ist ein wichtiger Schritt zu nützlicheren und natürlicheren Assistenten, denn auch Menschen kommunizieren, indem sie Worte, Bilder und Töne mischen. Die neuesten Modelle der großen Anbieter sind standardmäßig multimodal. Das erweitert die Anwendungsfälle stark – Barrierefreiheit, Bildung, Analyse von Dokumenten mit Bildern –, erbt aber dieselben Verlässlichkeitsgrenzen wie die übrige generative KI Generative KI erstellt aus einer Anweisung neue Inhalte – Text, Bilder, Audio oder Code – statt nur vorhandene Daten zu analysieren. Mehr im Glossar → .