Embedding (vecteur sémantique)

Un embedding est une façon de représenter une donnée — un mot, une phrase, un document ou une image — sous forme de liste de nombres, appelée vecteur, qui capture son sens. L’essentiel est que des éléments semblables obtiennent des vecteurs semblables, si bien qu’ils se retrouvent « proches » les uns des autres dans cet espace numérique : par exemple, « chien » et « chiot » seront voisins, tandis que « chien » et « avion » seront éloignés. Les modèles d’IA génèrent ces embeddings et peuvent ainsi comparer des sens de manière mathématique, et pas seulement des mots exacts. C’est la base de la recherche sémantique (trouver par le sens, pas par correspondance littérale), des systèmes de recommandation et de techniques comme la génération augmentée par récupération (RAG). Les embeddings sont souvent stockés dans des bases de données vectorielles. En somme, ils sont le pont entre le sens que comprennent les humains et les nombres que traitent les machines.