Clustering

De Wiki du Numérique Responsable

Le clustering est une technique d’apprentissage non supervisé qui regroupe automatiquement des données similaires, sans catégories définies à l’avance.

Elle sert à découvrir une structure : segments d’usagers, familles d’équipements aux profils de consommation proches, regroupement de journaux d’incidents.

Contrairement à la classification, aucune étiquette n’est fournie : c’est l’algorithme qui propose le découpage, et l’humain qui l’interprète. Deux paramétrages différents produisent des groupes différents, tous également « corrects » du point de vue du calcul.

L’algorithme le plus courant est K-means.

Voir aussi