Modèle de diffusion

Un modèle de diffusion est un type de modèle d’IA générative utilisé surtout pour créer des images, mais aussi de l’audio ou de la vidéo. Son fonctionnement est curieux : pendant l’entraînement, il apprend à inverser un processus qui ajoute de plus en plus de « bruit » (des taches aléatoires) à une image jusqu’à la détruire complètement. Une fois entraîné, il fait exactement l’inverse : il part d’un pur bruit aléatoire et le nettoie peu à peu, en de nombreuses étapes, jusqu’à ce qu’une image nette et cohérente émerge de ce chaos. Combiné à du texte, une consigne écrite guide ce processus pour que le résultat corresponde à ce que l’on a demandé. C’est la technologie derrière des générateurs d’images très connus comme Stable Diffusion, DALL·E ou Midjourney. Les modèles de diffusion ont largement supplanté les techniques antérieures grâce à la qualité et au réalisme de leurs résultats, et ils sont une pièce centrale de l’essor récent de l’IA générative.