Données d'entraînement
Les données d'entraînement sont l'ensemble des exemples — textes, images, sons — à partir desquels un modèle d'IA apprend ses motifs. Elles sont la matière première de l'apprentissage automatique, et leur quantité et surtout leur qualité déterminent directement le bon fonctionnement du modèle. Si les données sont incomplètes, dépassées ou empreintes de préjugés humains, le modèle hérite de ces défauts : c'est ainsi qu'apparaissent les biais. Elles soulèvent aussi d'importantes questions de protection des données et de droit d'auteur, selon leur provenance. Le savoir d'un modèle est « figé » au moment de son entraînement, il ne connaît donc les faits ultérieurs que si des sources externes lui sont reliées. Comprendre à partir de quelles données une IA apprend aide à juger ce à quoi on peut se fier et ce à quoi on ne le peut pas.
Articles où il apparaît
- IA Pourquoi ne faut-il pas se confier à ChatGPT ? Se confier à ChatGPT comporte des risques : vos données peuvent être conservées, aucun secret professionnel, des réponses parfois fausses. À savoir. Lire l’article
- IA Qu'est-ce que Claude Science ? Claude Science est l'atelier IA d'Anthropic pour la recherche : un environnement qui réunit recherche, analyse et résultats traçables. Tour d'horizon. Lire l’article