IA multimodal
Una IA multimodal es un sistema capaz de procesar y combinar distintos tipos de información —texto, imágenes, audio, vídeo— dentro de un mismo modelo, en lugar de manejar solo una modalidad. Gracias a ello puedes, por ejemplo, mostrarle una foto y preguntarle por ella, pedirle que describa un gráfico, que resuma un vídeo o que genere una imagen a partir de una frase. Es un paso importante hacia asistentes más útiles y naturales, porque las personas también nos comunicamos mezclando palabras, imágenes y sonidos. Los modelos más recientes de los grandes proveedores son multimodales de serie. Amplía mucho los casos de uso —accesibilidad, educación, análisis de documentos con imágenes— aunque hereda los mismos límites de fiabilidad que el resto de la IA generativa La IA generativa crea contenido nuevo —texto, imágenes, audio o código— a partir de una instrucción, en vez de solo analizar datos existentes. Más en el glosario → .