Skip to main content

Multivariate Clustering (Agrégation multivariée) (Outils de statistiques spatiales)

Résumé

Recherche des agrégats naturels d’entités en fonction uniquement des valeurs attributaires des entités.

En savoir plus sur le fonctionnement de l’outil Multivariate Clustering (Agrégation multivariée)

Illustration

Illustration de l’outil Agrégation multivariée

Utilisation

  • Cet outil génère une classe d’entités en sortie avec les champs utilisés dans l’analyse, ainsi qu’un nouveau champ d’entier appelé CLUSTER_ID. Le rendu par défaut repose sur le champ CLUSTER_ID et indique à quel agrégat appartient chaque entité. Si, par exemple, vous souhaitez utiliser trois agrégats, chaque enregistrement affichera 1, 2 ou 3 dans le champ CLUSTER_ID. La classe d’entités en sortie contiendra également un champ binaire nommé IS_SEED. Le champ IS_SEED indique quelles entités ont été initialement utilisées pour créer des agrégats. Le nombre de valeurs non nulles indiqué dans le champ IS_SEED correspond à la valeur que vous avez spécifiée pour le paramètre Number of Clusters (Nombre d’agrégats).

  • Le paramètre Input Features (Entités en entrée) peut s’appliquer à des points, des lignes ou des polygones.

  • Cet outil crée des messages et des diagrammes pour mieux comprendre les caractéristiques des agrégats identifiés. Pour accéder aux messages, survolez la barre de progression et cliquez sur le bouton contextuel ou développez la section View details (Afficher les détails) dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également accéder aux messages d’une exécution précédente de l’outil Multivariate Clustering (Agrégation multivariée) via l’historique de géotraitement. Accédez aux diagrammes à partir de la fenêtre Contents (Contenu).

  • Pour plus d’informations sur les diagrammes et les messages en sortie, reportez-vous à la rubrique Fonctionnement de l’outil Agrégation multivariée.

  • Les champs du paramètre Analysis Fields (Champs d’analyse) doivent être numériques et contenir diverses valeurs. Les champs sans variation (ceux dont la valeur est identique ou très similaire dans chaque enregistrement) seront exclus de l’analyse, mais inclus dans la valeur du paramètre Output Features (Entités en sortie). Vous pouvez utiliser des champs catégoriels avec l’outil Multivariate Clustering (Agrégation multivariée) s’ils sont représentés par des variables numériques fictives (1 pour toutes les entités d’une catégorie et 0 pour toutes les autres entités).

  • L’outil Multivariate Clustering (Agrégation multivariée) crée des agrégats non spatiaux. Dans certains cas, vous pouvez imposer certaines contraintes de contiguïté ou d’autres critères de proximité aux agrégats créés. Vous utiliserez alors l’outil Spatially Constrained Multivariate Clustering (Agrégation multivariée spatialement contrainte) pour créer des agrégats qui sont spatialement contigus.

  • Si vous utilisez cet outil, il est recommandé de commencer avec une seule variable pour le paramètre Analysis Fields (Champs d’analyse) et d’ajouter des variables si nécessaire. Les résultats sont plus faciles à interpréter avec moins de champs d’analyse. Il est également plus simple de déterminer quelles variables sont les meilleurs discriminants lorsque les champs sont peu nombreux.

  • Il existe trois options pour le paramètre Initialization Method (Méthode d’initialisation) : Optimized seed locations (Localisations des valeurs initiales optimisées), User defined seed locations (Localisations des valeurs initiales définies par l’utilisateur) et Random seed locations (Localisations des valeurs initiales aléatoires). Les valeurs initiales sont les entités utilisées pour créer chaque agrégat. Si, par exemple, vous entrez 3 pour le paramètre Number of Clusters (Nombre d’agrégats), l’analyse commence avec trois entités initiales. L'option par défaut, Optimized seed locations (Localisations des valeurs initiales optimisées), sélectionne la première valeur initiale de manière aléatoire et s’assure que les valeurs initiales suivantes sélectionnées représentent des entités qui sont éloignées les unes des autres dans l’espace de données (valeurs attributaires). Pour améliorer les performances, sélectionnez des valeurs initiales qui capturent différentes zones de l'espace de données. Lorsque des entités spécifiques reflètent des caractéristiques distinctes, vous pouvez les représenter dans différents agrégats. Dans ce cas, vous pouvez fournir ces localisations en créant un champ de valeurs initiales pour identifier ces entités particulières. Utilisez 0 pour toutes les valeurs sauf pour les entités initiales du champ initial que vous créez ; utilisez la valeur 1 pour les entités initiales. Sélectionnez ensuite l’option User defined seed locations (Localisations des valeurs initiales définies par l’utilisateur) pour le paramètre Initialization Method (Méthode d’initialisation). Si vous souhaitez effectuer une analyse de la sensibilité afin de déterminer quelles entités figurent systématiquement dans le même agrégat, utilisez l’option Random seed locations (Localisations des valeurs initiales aléatoires) pour le paramètre Initialization Method (Méthode d’initialisation). Pour cette option, les entités initiales sont sélectionnées au hasard.

    Remarque :

    Lorsque vous utilisez des valeurs initiales aléatoires, vous pouvez choisir une valeur initiale pour lancer le générateur de nombres aléatoires via le paramètre d’environnement Générateur de nombres aléatoires. Toutefois, le générateur de nombres aléatoires utilisé par cet outil est toujours Mersenne Twister.

  • Toute valeur 1 entrée dans le paramètre Initialization Field (Champ d’initialisation) est interprétée comme une valeur initiale. Si vous spécifiez des localisations initiales, le paramètre Number of Clusters (Nombre d’agrégats) est désactivé et l’outil recherche autant d’agrégats qu’il existe d’entrées non nulles dans le paramètre Initialization Field (Champ d’initialisation).

  • Si vous ne connaissez pas la valeur du paramètre Number of Clusters (Nombre d’agrégats) la plus appropriée pour vos données, vous pouvez essayer différents nombres d’agrégats et noter les valeurs qui permettent de mieux les différencier. Lorsque vous ne renseignez pas la valeur Number of Clusters (Nombre d’agrégats), l’outil vérifie le nombre optimal d’agrégats en calculant une statistique pseudo-F pour les solutions d’agrégation avec 2 à 30 agrégats et signale le nombre optimal d’agrégats dans la fenêtre de messages. Lorsque vous spécifiez une valeur facultative pour le paramètre Output Table for Evaluating Number of Clusters (Table en sortie pour évaluer le nombre d’agrégats), un diagramme est créé et représente les valeurs statistiques pseudo F pour les solutions de 2 à 30 agrégats. Les valeurs statistiques pseudo-F les plus élevées désignent les solutions qui optimisent le mieux les similarités à l'intérieur des agrégats et les différences entre les agrégats. Si aucun autre critère n’est utilisé pour la valeur du paramètre Number of Clusters (Nombre d’agrégats), utilisez un nombre associé à l’une des valeurs statistiques pseudo-F les plus élevées.

    Diagramme statistique de pseudo-F qui permet de rechercher le nombre optimal d’agrégats

  • Cet outil fait appel à l’algorithme des K-moyennes ou à celui des K-médoïdes pour diviser les entités en agrégats. Lorsque l’option Random seed locations (Localisations des valeurs initiales aléatoires) est sélectionnée pour le paramètre Initialization Method (Méthode d’initialisation), l’algorithme intègre des heuristiques et peut renvoyer un résultat différent chaque fois que vous exécutez l’outil (même si vous utilisez les mêmes données et paramètres d’outil). Cela est dû au caractère aléatoire de la recherche des entités initiales utilisées pour créer les agrégats. En raison de cette solution heuristique, l’identification du nombre optimal d’agrégats est plus complexe et la statistique pseudo-F peut être différente à chaque exécution de l’outil avec les différentes entités initiales. Pourtant, dans le cas d'une distribution distincte de vos données, les solutions trouvées à chaque exécution seront plus cohérentes. Par conséquent, pour mieux déterminer le nombre optimal d’agrégats, pour chaque nombre d’agrégats de 2 à 30, l’outil procède 10 fois à l’analyse et utilise la plus élevée des 10 valeurs statistiques pseudo-F.

  • Les options K means (K-moyennes) et K medoids (K-médoïdes) sont toutes deux couramment utilisées et produisent généralement des résultats similaires. L’option K medoids (K-médoïdes) est toutefois moins sensible au bruit et aux points aberrants du paramètre Input Features (Entités en entrée). L’algorithme K means (K-moyennes), généralement plus rapide que K medoids (K-médoïdes), est privilégié pour traiter des jeux de données volumineux.

  • Le nombre d’agrégats attribué à un jeu d’entités peut changer à chaque exécution. Par exemple, si vous partitionnez des entités en deux agrégats basés sur une variable de revenu, la première fois que vous lancez l’analyse, les entités de revenu élevé peuvent s’intituler « agrégat 2 » et les entités de faible revenu « agrégat 1 ». La deuxième fois que vous exécutez la même analyse, les entités de revenu élevé peuvent être étiquetées « agrégat 1 ». Vous pouvez également constater que certaines des entités de revenu moyen changent d’agrégat à chaque exécution.

Paramètres

Etiqueter Explication Type de données

Input Features (Entités en entrée)

Classe ou couche d’entités pour laquelle les agrégats seront créés.

Feature Layer

Entités en sortie

Classe d’entités en sortie créée qui contient toutes les entités, les champs d’analyse spécifiés, ainsi qu’un champ permettant d’identifier l’agrégat auquel chaque entité appartient.

Feature Class

Champs d’analyse

Liste de champs à utiliser pour distinguer les agrégats entre eux.

Field

Méthode d’agrégation

(Facultatif)

Spécifie l’algorithme d’agrégation utilisé.

Les options K means (K-moyennes) et K medoids (K-médoïdes) sont toutes deux couramment utilisées et produisent généralement des résultats similaires. L’option K medoids (K-médoïdes) est toutefois moins sensible au bruit et aux points aberrants du paramètre Input Features (Entités en entrée). L’algorithme K means (K-moyennes), généralement plus rapide que K medoids (K-médoïdes), est privilégié pour traiter des jeux de données volumineux.

  • K-moyennesLa valeur du paramètre Input Features (Entités en entrée) est agrégée à l’aide de l’algorithme des K-moyennes. Il s’agit de l’option par défaut.

  • K-médoïdesLa valeur du paramètre Input Features (Entités en entrée) est agrégée avec l’algorithme des K-médoïdes.

String

Méthode d'initialisation

(Facultatif)

Indique comment les valeurs initiales sont obtenues pour créer des agrégats. Si vous spécifiez trois agrégats, par exemple, l’analyse commence avec trois valeurs initiales.

  • Emplacements initiaux optimisésDes entités initiales sont sélectionnées pour optimiser les résultats d’analyse et les performances. Il s’agit de l’option par défaut.

  • Emplacements initiaux définis par l’utilisateurLes entrées non nulles dans le paramètre Initialization Field (Champ d’initialisation) sont initialement utilisées pour développer des agrégats.

  • Emplacements initiaux aléatoiresLes entités initiales seront sélectionnées de manière aléatoire.

String

Champ d'initialisation

(Facultatif)

Champ numérique identifiant les entités initiales. Les entités ayant la valeur 1 dans ce champ sont utilisées pour créer des agrégats. Chaque valeur initiale génère un agrégat, donc vous devez fournir au moins deux entités initiales.

Field

Nombre d’agrégats

(Facultatif)

Nombre d’agrégats créés. Si vous ne renseignez pas ce paramètre, l’outil vérifie le nombre optimal d’agrégats en calculant une statistique pseudo-F pour les solutions d’agrégation avec 2 à 30 agrégats.

Ce paramètre est désactivé si les emplacements initiaux ont été fournis dans le champ d’initialisation.

Long

Table en sortie pour vérifier le nombre d’agrégats

(Facultatif)

Table créée contenant la statistique pseudo-F pour les solutions d’agrégation de 2 à 30, calculée pour vérifier le nombre optimal d’agrégats. Le diagramme créé à partir de cette table est accessible dans la section des tables autonomes de la fenêtre Contents (Contenu).

Table

Données d’échelle

(Facultatif)

Indique si les valeurs de chaque champ d’analyse sont mises à l’échelle pour que la moyenne soit égale à 0 et la variance, à un. Cette mise à l’échelle garantit que chaque champ d’analyse a une priorité égale dans les résultats. La mise à l’échelle supprime également l’effet des unités linéaires ; par exemple, les mêmes données mesurées en mètres et en pieds donnent une sortie équivalente. Dans certains cas, tels que les intégrations, la magnitude des valeurs des variables est liée à leur importance. Les variables de ce type ne doivent pas être mises à l’échelle.

  • ActivéLes valeurs de chaque champ d’analyse seront mises à l’échelle pour que la variance soit égale à un grâce à la division de chaque valeur par l’écart type du champ d’analyse. Il s’agit de l’option par défaut.

  • DécochéLa variance de chaque champ d’analyse ne sera pas mise à l’échelle.

Boolean

Environnements

Système de coordonnées en sortie, Transformations géographiques, Espace de travail courant, Espace de travail temporaire, Gérer les noms de champs complets, Valeurs M en sortie, Résolution M, Tolérance M, Valeurs Z en sortie, Valeur Z en sortie par défaut, Résolution Z, Tolérance Z, Résolution XY, Tolérance XY, Générateur de nombres aléatoires

Cas particuliers

Système de coordonnées en sortie

Feature geometry is projected to the Output Coordinate System prior to analysis. All mathematical computations are based on the Output Coordinate System spatial reference. When the Output Coordinate System is based on degrees, minutes, and seconds, geodesic distances are estimated using chordal distances.

Générateur de nombres aléatoires

The Random Generator Type used is always Mersenne Twister.

Informations de licence

  • Basic: Oui
  • Standard: Oui
  • Advanced: Oui