Aller au contenu
COCOWORK, INC.

GLOSSAIRE IA · TECHNIQUE

Modèle de diffusion

Diffusion, diffusion model

Un modèle de diffusion est la technique qui produit la quasi-totalité des images générées par IA. Le principe est contre-intuitif : le modèle apprend à retirer du bruit d'une image, puis on lui donne une image entièrement composée de bruit et une description, et il la débruite jusqu'à faire apparaître ce qui a été demandé.

Traduction
Modèle de diffusion
Principe
Débruitage progressif
Entrée
Bruit aléatoire plus une consigne
Sorties
Image, vidéo, audio
Outils concernés
Midjourney, DALL-E, Veo
Catégorie
Architecture générative
DÉFINITION [Modèle de diffusion.1]

Sculpter dans du bruit

Le modèle n'ajoute pas des éléments à une toile vide, il retire ce qui n'est pas l'image.

L'entraînement se fait à l'envers de l'usage. On prend des millions d'images réelles et on leur ajoute progressivement du bruit, jusqu'à les réduire à une neige informe. Le modèle apprend à effectuer l'opération inverse : étant donné une image bruitée, retrouver ce à quoi elle ressemblait juste avant.

Une fois cette compétence acquise, la génération devient possible. On part d'une image constituée uniquement de bruit aléatoire et on demande au modèle de la débruiter, en lui indiquant par une description ce qu'il doit y voir. À chaque passe, il retire un peu de bruit dans la direction indiquée par la consigne.

Au bout de quelques dizaines d'étapes, une image cohérente émerge. Elle n'existait nulle part au départ : elle a été façonnée par la contrainte de la description appliquée à un point de départ aléatoire. C'est aussi pourquoi la même consigne donne à chaque fois une image différente.

MÉCANIQUE [Modèle de diffusion.2]

Ce qui se passe entre la consigne et l'image

Quatre étapes, dont la troisième se répète des dizaines de fois.

  1. 01

    La consigne est encodée

    Votre description est convertie en une représentation numérique de son sens, un embedding, qui servira de boussole tout au long du processus.

  2. 02

    On part de bruit pur

    Le point de départ est une image aléatoire, sans aucune structure. C'est ce tirage initial qui explique qu'une même consigne ne donne jamais deux fois le même résultat.

  3. 03

    Le débruitage itératif

    Le modèle retire une fraction du bruit, guidé par l'encodage de la consigne. L'opération se répète, et à chaque tour l'image devient un peu plus nette et un peu plus conforme à la description.

  4. 04

    Le rendu final

    Après un nombre d'étapes défini, l'image est finalisée et éventuellement agrandie. Plus le nombre d'étapes est élevé, plus le résultat est fin, et plus le calcul coûte cher.

USAGES [Modèle de diffusion.3]

Ce que la diffusion rend possible

Bien au-delà de la génération d'images à partir de texte.

  • Génération d'images

    L'usage le plus connu : produire une illustration, un visuel ou une photographie de synthèse à partir d'une description écrite.

  • Retouche par zone

    Sélectionner une région d'une image existante et demander sa transformation, le modèle ne débruitant que la zone concernée en tenant compte du reste.

  • Extension de cadre

    Prolonger une image au-delà de ses bords en générant ce qui pourrait s'y trouver, opération impossible avant ces modèles.

  • Génération de vidéo

    Les générateurs de vidéo appliquent le même principe en ajoutant la cohérence entre les images successives, ce qui reste le point le plus difficile.

  • Audio et musique

    La même mécanique de débruitage progressif s'applique à des représentations sonores, pour produire de la voix ou de la musique.

LIMITES [Modèle de diffusion.4]

Ce que la diffusion fait mal

Les défauts caractéristiques viennent tous du même mécanisme.

  • Le texte dans l'image

    Le modèle apprend des formes, pas des caractères. Écrire un mot correctement suppose une précision que le débruitage progressif atteint difficilement, même si les derniers modèles ont beaucoup progressé.

  • Les détails à structure stricte

    Mains, dents, mécanismes, perspective architecturale : tout ce qui obéit à une règle rigide met en défaut un procédé qui fonctionne par ressemblance globale.

  • La reproductibilité

    Le point de départ étant aléatoire, obtenir exactement la même image deux fois demande de fixer la graine du tirage, ce que tous les outils n'exposent pas.

  • Le coût de calcul

    Chaque image demande des dizaines de passes dans un grand réseau. C'est ce qui explique les systèmes de crédits et les files d'attente sur les outils grand public.

EN CLAIR

Pour le dire simplement

Regardez un écran de télévision sans signal, cette neige grise qui grouille. Maintenant imaginez quelqu'un capable d'y distinguer peu à peu une forme, et de gommer tout ce qui n'en fait pas partie, jusqu'à ce qu'un paysage apparaisse. C'est exactement ce que fait un modèle de diffusion, sauf que ce qu'il doit y voir lui est dicté par votre description.

IDÉES REÇUES [Modèle de diffusion.MYTH]

Ce qu'il faut arrêter de croire.

  • IDÉE REÇUE

    Le modèle assemble des morceaux d'images existantes.

    EN RÉALITÉ

    Aucun fragment d'image n'est stocké ni collé. Le modèle a appris des régularités statistiques et façonne une image nouvelle à partir de bruit. C'est pour cela qu'on ne peut pas retrouver l'image d'origine d'un rendu.

  • IDÉE REÇUE

    La même consigne donne toujours la même image.

    EN RÉALITÉ

    Le point de départ est un tirage aléatoire, donc le résultat varie à chaque génération. Certains outils permettent de fixer ce tirage pour reproduire une image, mais ce n'est pas le comportement par défaut.

  • IDÉE REÇUE

    Plus d'étapes de débruitage donne toujours une meilleure image.

    EN RÉALITÉ

    La qualité progresse puis plafonne. Au-delà d'un certain nombre d'étapes, on paie du calcul supplémentaire pour un gain visuel imperceptible, ce que les outils grand public arbitrent à votre place.

  • IDÉE REÇUE

    La diffusion sert uniquement aux images.

    EN RÉALITÉ

    Le même principe s'applique à la vidéo, à la voix et à la musique. Ce qui change est la représentation sur laquelle on travaille, pas le mécanisme de débruitage progressif.

FAQ [Modèle de diffusion.FAQ]

Questions fréquentes.

Qu'est-ce qu'un modèle de diffusion ?

C'est un modèle génératif qui apprend à retirer du bruit d'une image. Pour générer, on lui donne du bruit pur et une description, et il débruite progressivement jusqu'à faire apparaître une image conforme à la consigne. C'est la technique derrière la quasi-totalité des générateurs d'images actuels.

Quels outils utilisent la diffusion ?

Midjourney, les générateurs d'images intégrés aux assistants, la plupart des outils de retouche générative et les générateurs de vidéo comme Veo, Runway ou Kling. C'est devenu l'approche dominante pour tout ce qui est génération visuelle.

Quelle différence entre diffusion et transformeur ?

Le transformeur est l'architecture des modèles de langage, qui produisent du texte token après token. La diffusion produit une image par débruitage progressif. Les deux se combinent souvent : un transformeur encode la consigne textuelle qui guide le débruitage.

Pourquoi les modèles de diffusion écrivent-ils mal le texte ?

Parce qu'ils apprennent des formes visuelles et non des caractères. Un texte lisible demande une exactitude que le débruitage progressif atteint mal, chaque lettre étant traitée comme une forme parmi d'autres. Les derniers modèles ont fortement progressé sur ce point sans le résoudre complètement.

Pourquoi la génération d'images consomme-t-elle des crédits ?

Parce que chaque image demande des dizaines de passes dans un grand réseau de neurones, ce qui mobilise des processeurs graphiques pendant plusieurs secondes. C'est nettement plus coûteux que la génération d'une réponse textuelle, d'où les systèmes de crédits et de quotas.

Peut-on retrouver les images d'entraînement dans un rendu ?

Le modèle ne stocke aucune image et compose à partir de bruit. Des cas de reproduction proche d'une image très répétée dans le corpus ont été documentés, mais ce sont des exceptions liées à la sur-représentation, pas le fonctionnement normal.

← Retour au glossaire

Révisé le 27 juillet 2026