Transformer
Le transformer est une architecture de réseau de neurones, présentée par des chercheurs de Google en 2017, qui a révolutionné le traitement du langage et constitue la base des grands modèles actuels. Son idée clé est le mécanisme d'« attention », qui permet au modèle de pondérer quels mots d'un texte sont les plus importants les uns pour les autres — quelle que soit leur distance — et de saisir ainsi le contexte bien mieux que les techniques précédentes. De plus, il traite le texte en parallèle plutôt que mot à mot, ce qui rend l'entraînement à grande échelle bien plus efficace. Le « T » de GPT signifie précisément « transformer ». Bien qu'il soit né pour le langage, il est aujourd'hui aussi utilisé pour les images, l'audio et d'autres domaines. C'est, sans exagérer, la pièce technique qui a rendu possible l'actuelle vague d'IA générative.