Données d'entraînement
De Wiki du Numérique Responsable
Les données d’entraînement sont l’ensemble des exemples, textes, images, sons, données structurées, à partir desquels un modèle d’intelligence artificielle apprend.
Ce qui en dépend
La qualité, la représentativité et la provenance de ces données déterminent les performances du modèle et ses défauts. Un modèle ne peut pas mieux valoir que les données qui l’ont formé.
Quatre points de vigilance :
- la représentativité : quelles populations, langues, situations sont présentes, et lesquelles manquent (voir Biais algorithmique) ;
- la provenance et les droits : les contenus utilisés étaient-ils libres d’usage pour cette finalité ;
- les données personnelles : leur présence engage le RGPD, y compris pour un modèle entraîné par un tiers ;
- la traçabilité : l’AI Act impose une documentation des jeux de données pour les modèles à usage général.
Enjeu de sobriété
Accroître le volume de données n’améliore pas indéfiniment un modèle, mais en augmente toujours le coût d’entraînement. Un jeu plus restreint, mieux constitué et mieux documenté produit souvent un meilleur résultat qu’une accumulation indifférenciée.