Aller au contenu
COCOWORK, INC.

GLOSSAIRE IA · TECHNIQUE

Transformeur

Transformer, architecture d'attention

Le transformeur est l'architecture de réseau de neurones sur laquelle reposent tous les grands modèles de langage actuels. Sa trouvaille est le mécanisme d'attention : pour traiter un mot, le modèle regarde simultanément tous les autres mots de la phrase et pondère ceux qui comptent, au lieu de lire de gauche à droite.

Année d'origine
2017
Idée clé
Mécanisme d'attention
Le T de GPT
Transformer
Avantage décisif
Traitement parallélisable
Champ d'application
Texte, image, audio, code
Catégorie
Architecture de réseau
DÉFINITION [Transformeur.1]

Le problème que le transformeur a résolu

Avant lui, une machine lisait une phrase mot après mot, et oubliait le début en arrivant à la fin.

Les architectures antérieures traitaient le texte de manière séquentielle : un mot, puis le suivant, en conservant une mémoire de ce qui précédait. Deux problèmes en découlaient. Cette mémoire se dégradait sur les phrases longues, et le traitement séquentiel interdisait de paralléliser les calculs, ce qui plafonnait la taille des modèles.

Le transformeur, présenté en 2017, supprime la séquence. Tous les mots sont traités en même temps, et pour chacun le modèle calcule à quel point les autres mots de la phrase le concernent. C'est le mécanisme d'attention.

Prenez « la clé n'entrait pas dans la serrure parce qu'elle était trop grosse ». Pour savoir à quoi renvoie « elle », le modèle pondère l'ensemble des mots précédents et attribue beaucoup de poids à « clé ». Cette pondération est apprise, pas programmée.

MÉCANIQUE [Transformeur.2]

Comment un transformeur traite une phrase

Quatre étapes, dont la troisième constitue toute l'originalité.

  1. 01

    Découpage en tokens

    Le texte est fragmenté en unités élémentaires, les tokens, qui correspondent à des mots ou à des morceaux de mots.

  2. 02

    Conversion en vecteurs

    Chaque token devient une liste de nombres qui encode son sens, appelée embedding. Une information de position y est ajoutée, puisque l'ordre n'est plus donné par la séquence de lecture.

  3. 03

    Passage par les couches d'attention

    À chaque couche, chaque token regarde tous les autres et ajuste sa représentation en fonction de ceux qui le concernent. Plusieurs mécanismes d'attention travaillent en parallèle, chacun captant un type de relation différent.

  4. 04

    Production de la sortie

    Après avoir traversé des dizaines de couches, la représentation finale sert à prédire le token suivant, ou à produire une classification selon la tâche.

PORTÉE [Transformeur.3]

Pourquoi cette architecture a tout emporté

Trois propriétés expliquent qu'elle ait remplacé toutes les autres en quelques années.

  • Elle se parallélise

    Traiter tous les tokens simultanément permet d'exploiter pleinement les processeurs graphiques. C'est ce qui a rendu possible l'entraînement de modèles à des milliards de paramètres.

  • Elle tient la distance

    L'attention relie directement deux mots éloignés de mille positions, là où une architecture séquentielle aurait perdu le fil. C'est ce qui permet aux modèles de raisonner sur de longs documents.

  • Elle passe à l'échelle

    Augmenter la taille du modèle et le volume de données améliore les performances de façon régulière et prévisible. Cette propriété a orienté toute la stratégie du secteur depuis 2020.

  • Elle n'est pas propre au texte

    La même architecture traite des images découpées en fragments, du son, du code ou des séquences biologiques. Cette généralité explique sa domination bien au-delà du langage.

LIMITES [Transformeur.4]

Ce que le transformeur coûte

Sa force est aussi son point faible.

  • Le coût explose avec la longueur

    Chaque token regardant tous les autres, le calcul croît avec le carré de la longueur du texte. Doubler la taille d'un document quadruple le travail, ce qui explique pourquoi les longs contextes coûtent cher.

  • Il n'y a pas de mémoire persistante

    Un transformeur ne retient rien d'une conversation à l'autre. Tout ce dont il dispose tient dans sa fenêtre de contexte, qu'il faut lui redonner à chaque appel.

  • L'entraînement est hors de portée pour presque tous

    Entraîner un grand transformeur depuis zéro suppose des moyens de calcul réservés à une poignée d'acteurs. Tout le monde part de modèles existants.

  • Il prédit, il ne vérifie pas

    L'architecture est excellente pour produire une suite plausible. Rien dedans ne garantit qu'elle soit vraie, ce qui explique la persistance des hallucinations.

EN CLAIR

Pour le dire simplement

Une architecture séquentielle lit un roman page après page et tente de se souvenir du début. Un transformeur étale toutes les pages sur une immense table et, pour chaque phrase qu'il traite, jette un œil à toutes les autres en même temps pour repérer celles qui l'éclairent. C'est infiniment plus efficace, et cela explique pourquoi la table doit être si grande, et pourquoi elle coûte si cher.

IDÉES REÇUES [Transformeur.MYTH]

Ce qu'il faut arrêter de croire.

  • IDÉE REÇUE

    Transformeur et grand modèle de langage, c'est la même chose.

    EN RÉALITÉ

    Le transformeur est l'architecture, le modèle de langage est ce qu'on obtient en l'entraînant sur du texte. La même architecture entraînée sur des images produit tout autre chose.

  • IDÉE REÇUE

    Le mécanisme d'attention imite l'attention humaine.

    EN RÉALITÉ

    Le nom est une image. Il s'agit d'un calcul de pondération entre éléments, appris statistiquement. Aucun rapport avec la sélection consciente d'informations chez un humain.

  • IDÉE REÇUE

    Les transformeurs comprennent la grammaire.

    EN RÉALITÉ

    Ils reproduisent avec une grande fidélité les régularités grammaticales présentes dans leurs données, sans manipuler de règles explicites. Le résultat est correct sans que la règle existe quelque part dans le modèle.

  • IDÉE REÇUE

    C'est une technologie dépassée depuis 2017.

    EN RÉALITÉ

    L'architecture de base a près de dix ans et reste la fondation de tout ce qui se fait. Ce qui a changé depuis, c'est l'échelle, les méthodes d'entraînement et une série d'optimisations, pas le principe.

FAQ [Transformeur.FAQ]

Questions fréquentes.

Qu'est-ce qu'un transformeur en intelligence artificielle ?

C'est une architecture de réseau de neurones introduite en 2017, fondée sur un mécanisme d'attention qui permet à chaque élément d'un texte de tenir compte de tous les autres simultanément. C'est la base de tous les grands modèles de langage actuels.

Que signifie le T de GPT ?

Transformer. GPT signifie Generative Pre-trained Transformer, soit transformeur génératif pré-entraîné. Le nom décrit exactement ce qu'est le modèle : un transformeur, entraîné au préalable sur un vaste corpus, et conçu pour générer du texte.

Qu'est-ce que le mécanisme d'attention ?

C'est le calcul par lequel le modèle détermine, pour chaque mot traité, quels autres mots de la phrase comptent et à quel degré. Cette pondération est apprise pendant l'entraînement et permet de résoudre les références et les dépendances à longue distance.

Pourquoi les longs textes coûtent-ils si cher à traiter ?

Parce que chaque token doit être comparé à tous les autres, le coût de calcul croît avec le carré de la longueur. Un document deux fois plus long demande environ quatre fois plus de travail, ce qui explique la tarification des grandes fenêtres de contexte.

Les transformeurs servent-ils uniquement au texte ?

Non. La même architecture traite des images découpées en fragments, du son, du code, de la vidéo et même des séquences biologiques. Cette polyvalence est l'une des raisons de sa domination dans tous les champs de l'IA depuis 2020.

Existe-t-il des alternatives au transformeur ?

Des architectures concurrentes sont activement étudiées, souvent pour réduire le coût sur les textes très longs. Certaines montrent des résultats prometteurs, mais aucune n'a détrôné le transformeur sur l'ensemble des tâches à ce jour.

← Retour au glossaire

Révisé le 27 juillet 2026