Données d'entraînement

Les données d'entraînement sont l'ensemble des exemples — textes, images, sons — à partir desquels un modèle d'IA apprend ses motifs. Elles sont la matière première de l'apprentissage automatique, et leur quantité et surtout leur qualité déterminent directement le bon fonctionnement du modèle. Si les données sont incomplètes, dépassées ou empreintes de préjugés humains, le modèle hérite de ces défauts : c'est ainsi qu'apparaissent les biais. Elles soulèvent aussi d'importantes questions de protection des données et de droit d'auteur, selon leur provenance. Le savoir d'un modèle est « figé » au moment de son entraînement, il ne connaît donc les faits ultérieurs que si des sources externes lui sont reliées. Comprendre à partir de quelles données une IA apprend aide à juger ce à quoi on peut se fier et ce à quoi on ne le peut pas.

Articles où il apparaît