IA multimodal
Uma IA multimodal é um sistema capaz de processar e combinar diferentes tipos de informação — texto, imagens, áudio, vídeo — dentro de um mesmo modelo, em vez de lidar com apenas uma modalidade. Graças a isso você pode, por exemplo, mostrar uma foto e perguntar sobre ela, pedir que descreva um gráfico, que resuma um vídeo ou que gere uma imagem a partir de uma frase. É um passo importante rumo a assistentes mais úteis e naturais, porque as pessoas também nos comunicamos misturando palavras, imagens e sons. Os modelos mais recentes dos grandes provedores são multimodais por padrão. Isso amplia muito os casos de uso — acessibilidade, educação, análise de documentos com imagens — embora herde os mesmos limites de confiabilidade do restante da IA generativa A IA generativa cria conteúdo novo — texto, imagens, áudio ou código — a partir de uma instrução, em vez de apenas analisar dados já existentes. Mais no glossário → .