Clustering
De Wiki du Numérique Responsable
Le clustering est une technique d’apprentissage non supervisé qui regroupe automatiquement des données similaires, sans catégories définies à l’avance.
Elle sert à découvrir une structure : segments d’usagers, familles d’équipements aux profils de consommation proches, regroupement de journaux d’incidents.
Contrairement à la classification, aucune étiquette n’est fournie : c’est l’algorithme qui propose le découpage, et l’humain qui l’interprète. Deux paramétrages différents produisent des groupes différents, tous également « corrects » du point de vue du calcul.
L’algorithme le plus courant est K-means.