GLOSSAIRE IA · TECHNIQUE
Transformeur
Transformer, architecture d'attention
Le transformeur est l'architecture de réseau de neurones sur laquelle reposent tous les grands modèles de langage actuels. Sa trouvaille est le mécanisme d'attention : pour traiter un mot, le modèle regarde simultanément tous les autres mots de la phrase et pondère ceux qui comptent, au lieu de lire de gauche à droite.
- Année d'origine
- 2017
- Idée clé
- Mécanisme d'attention
- Le T de GPT
- Transformer
- Avantage décisif
- Traitement parallélisable
- Champ d'application
- Texte, image, audio, code
- Catégorie
- Architecture de réseau
Le problème que le transformeur a résolu
Avant lui, une machine lisait une phrase mot après mot, et oubliait le début en arrivant à la fin.
Les architectures antérieures traitaient le texte de manière séquentielle : un mot, puis le suivant, en conservant une mémoire de ce qui précédait. Deux problèmes en découlaient. Cette mémoire se dégradait sur les phrases longues, et le traitement séquentiel interdisait de paralléliser les calculs, ce qui plafonnait la taille des modèles.
Le transformeur, présenté en 2017, supprime la séquence. Tous les mots sont traités en même temps, et pour chacun le modèle calcule à quel point les autres mots de la phrase le concernent. C'est le mécanisme d'attention.
Prenez « la clé n'entrait pas dans la serrure parce qu'elle était trop grosse ». Pour savoir à quoi renvoie « elle », le modèle pondère l'ensemble des mots précédents et attribue beaucoup de poids à « clé ». Cette pondération est apprise, pas programmée.
Comment un transformeur traite une phrase
Quatre étapes, dont la troisième constitue toute l'originalité.
- 01
Découpage en tokens
Le texte est fragmenté en unités élémentaires, les tokens, qui correspondent à des mots ou à des morceaux de mots.
- 02
Conversion en vecteurs
Chaque token devient une liste de nombres qui encode son sens, appelée embedding. Une information de position y est ajoutée, puisque l'ordre n'est plus donné par la séquence de lecture.
- 03
Passage par les couches d'attention
À chaque couche, chaque token regarde tous les autres et ajuste sa représentation en fonction de ceux qui le concernent. Plusieurs mécanismes d'attention travaillent en parallèle, chacun captant un type de relation différent.
- 04
Production de la sortie
Après avoir traversé des dizaines de couches, la représentation finale sert à prédire le token suivant, ou à produire une classification selon la tâche.
Pourquoi cette architecture a tout emporté
Trois propriétés expliquent qu'elle ait remplacé toutes les autres en quelques années.
-
Elle se parallélise
Traiter tous les tokens simultanément permet d'exploiter pleinement les processeurs graphiques. C'est ce qui a rendu possible l'entraînement de modèles à des milliards de paramètres.
-
Elle tient la distance
L'attention relie directement deux mots éloignés de mille positions, là où une architecture séquentielle aurait perdu le fil. C'est ce qui permet aux modèles de raisonner sur de longs documents.
-
Elle passe à l'échelle
Augmenter la taille du modèle et le volume de données améliore les performances de façon régulière et prévisible. Cette propriété a orienté toute la stratégie du secteur depuis 2020.
-
Elle n'est pas propre au texte
La même architecture traite des images découpées en fragments, du son, du code ou des séquences biologiques. Cette généralité explique sa domination bien au-delà du langage.
Ce que le transformeur coûte
Sa force est aussi son point faible.
-
Le coût explose avec la longueur
Chaque token regardant tous les autres, le calcul croît avec le carré de la longueur du texte. Doubler la taille d'un document quadruple le travail, ce qui explique pourquoi les longs contextes coûtent cher.
-
Il n'y a pas de mémoire persistante
Un transformeur ne retient rien d'une conversation à l'autre. Tout ce dont il dispose tient dans sa fenêtre de contexte, qu'il faut lui redonner à chaque appel.
-
L'entraînement est hors de portée pour presque tous
Entraîner un grand transformeur depuis zéro suppose des moyens de calcul réservés à une poignée d'acteurs. Tout le monde part de modèles existants.
-
Il prédit, il ne vérifie pas
L'architecture est excellente pour produire une suite plausible. Rien dedans ne garantit qu'elle soit vraie, ce qui explique la persistance des hallucinations.
EN CLAIR
Pour le dire simplement
Une architecture séquentielle lit un roman page après page et tente de se souvenir du début. Un transformeur étale toutes les pages sur une immense table et, pour chaque phrase qu'il traite, jette un œil à toutes les autres en même temps pour repérer celles qui l'éclairent. C'est infiniment plus efficace, et cela explique pourquoi la table doit être si grande, et pourquoi elle coûte si cher.
Ce qu'il faut arrêter de croire.
-
IDÉE REÇUE
Transformeur et grand modèle de langage, c'est la même chose.
EN RÉALITÉ
Le transformeur est l'architecture, le modèle de langage est ce qu'on obtient en l'entraînant sur du texte. La même architecture entraînée sur des images produit tout autre chose.
-
IDÉE REÇUE
Le mécanisme d'attention imite l'attention humaine.
EN RÉALITÉ
Le nom est une image. Il s'agit d'un calcul de pondération entre éléments, appris statistiquement. Aucun rapport avec la sélection consciente d'informations chez un humain.
-
IDÉE REÇUE
Les transformeurs comprennent la grammaire.
EN RÉALITÉ
Ils reproduisent avec une grande fidélité les régularités grammaticales présentes dans leurs données, sans manipuler de règles explicites. Le résultat est correct sans que la règle existe quelque part dans le modèle.
-
IDÉE REÇUE
C'est une technologie dépassée depuis 2017.
EN RÉALITÉ
L'architecture de base a près de dix ans et reste la fondation de tout ce qui se fait. Ce qui a changé depuis, c'est l'échelle, les méthodes d'entraînement et une série d'optimisations, pas le principe.
Questions fréquentes.
Qu'est-ce qu'un transformeur en intelligence artificielle ?
C'est une architecture de réseau de neurones introduite en 2017, fondée sur un mécanisme d'attention qui permet à chaque élément d'un texte de tenir compte de tous les autres simultanément. C'est la base de tous les grands modèles de langage actuels.
Que signifie le T de GPT ?
Transformer. GPT signifie Generative Pre-trained Transformer, soit transformeur génératif pré-entraîné. Le nom décrit exactement ce qu'est le modèle : un transformeur, entraîné au préalable sur un vaste corpus, et conçu pour générer du texte.
Qu'est-ce que le mécanisme d'attention ?
C'est le calcul par lequel le modèle détermine, pour chaque mot traité, quels autres mots de la phrase comptent et à quel degré. Cette pondération est apprise pendant l'entraînement et permet de résoudre les références et les dépendances à longue distance.
Pourquoi les longs textes coûtent-ils si cher à traiter ?
Parce que chaque token doit être comparé à tous les autres, le coût de calcul croît avec le carré de la longueur. Un document deux fois plus long demande environ quatre fois plus de travail, ce qui explique la tarification des grandes fenêtres de contexte.
Les transformeurs servent-ils uniquement au texte ?
Non. La même architecture traite des images découpées en fragments, du son, du code, de la vidéo et même des séquences biologiques. Cette polyvalence est l'une des raisons de sa domination dans tous les champs de l'IA depuis 2020.
Existe-t-il des alternatives au transformeur ?
Des architectures concurrentes sont activement étudiées, souvent pour réduire le coût sur les textes très longs. Certaines montrent des résultats prometteurs, mais aucune n'a détrôné le transformeur sur l'ensemble des tâches à ce jour.
Termes liés.
Révisé le 27 juillet 2026