Agrégation basée sur la densité (Outils de statistiques spatiales)
Résumé
Recherche des agrégats d’entités ponctuelles dans le bruit environnant en fonction de leur distribution spatiale. Le temps peut également être incorporé pour rechercher des agrégats spatio-temporels.
Illustration

Utilisation
Cet outil extrait les agrégats de la valeur du paramètre Input Point Features (Entités ponctuelles en entrée) et identifie tout bruit environnant.
Il existe trois options pour le paramètre Clustering Method (Méthode d’agrégation). L’option Defined distance (DBSCAN) (Distance définie [DBSCAN]) recherche les agrégats de points situés à proximité en fonction de la distance de recherche spécifiée. L’option Self-adjusting (HDBSCAN) (Ajustement automatique [HDBSCAN]) recherche les agrégats de points de la même manière que la méthode DBSCAN à ceci près qu’elle utilise des distances variables, ce qui permet de rechercher les agrégats de densité variable selon la probabilité de l’agrégation (c’est-à-dire leur stabilité). L’option Multi-scale (OPTICS) (Multi-échelles [OPTICS]) classe les points en entrée en fonction de la distance la plus courte jusqu’à l’entité suivante. Un diagramme d’accès est alors construit ; les agrégats sont obtenus en fonction du nombre minimal de points considérés comme des membres de l’agrégat, une distance de recherche et les caractéristiques du diagramme d’accès (telles que la pente et la hauteur des pics).
Cet outil produit une classe d’entités en sortie avec un nouveau champ d’entier nommé
CLUSTER_IDmontrant l’agrégat auquel appartient chacun des points. Le rendu par défaut dépend du champCOLOR_ID. Une couleur différente sera assignée à chaque agrégat. Les couleurs sont attribuées et répétées de sorte que chaque agrégat se distingue visuellement des agrégats environnants.Cet outil crée également des messages et des diagrammes, que vous pouvez consulter pour comprendre les caractéristiques des agrégats identifiés. Pour accéder aux messages, passez le curseur de la souris sur la barre d’avancement et cliquez sur le bouton de menu contextuel ou développez la section des messages dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également accéder aux messages d’une précédente exécution de cet outil via l’historique de géotraitement. Les diagrammes sont accessibles à partir de la fenêtre Contents (Contenu).
Pour en savoir plus sur les messages et diagrammes en sortie, ainsi que sur les algorithmes utilisés par cet outil, reportez-vous à la rubrique Fonctionnement de l’agrégation basée sur la densité.
Si Self-adjusting (HDBSCAN) (Ajustement automatique [HDBSCAN]) est spécifié pour le paramètre Clustering Method (Méthode d’agrégation), la classe d’entités en sortie contient également les champs suivants :
PROB, désignant la probabilité selon laquelle le point appartient au groupe d’affectation,OUTLIER, indiquant que le point peut être un point aberrant au sein de son propre agrégat (une valeur élevée indique que le point est susceptible d’être un point aberrant) etEXEMPLAR, signalant les points les plus prototypiques ou les points les plus représentatifs de chaque agrégat.Si Multi-scale (OPTICS) (Multi-échelles [OPTICS]) est spécifié pour le paramètre Clustering Method (Méthode d’agrégation), la classe d’entités en sortie contient également les champs suivants :
REACHORDER, indiquant la façon dont les valeurs Input Point Features (Entités ponctuelles en entrée) sont classées en vue de l’analyse etREACHDIST, qui représente la distance séparant chaque point de son voisin non visité le plus proche.Pour les options Defined distance (DBSCAN) (Distance définie [DBSCAN]) et Multi-scale (OPTICS) (Multi-échelles [OPTICS]) du paramètre Clustering Method (Méthode d’agrégation), la valeur du paramètre Search Distance (Distance de recherche) par défaut est la distance principale la plus élevée du jeu de données en excluant les distances principales figurant dans le 1% supérieur (c’est-à-dire en excluant les distances principales les plus extrêmes).
Pour les options Defined distance (DBSCAN) (Distance définie [DBSCAN]) et Multi-scale (OPTICS) (Multi-échelles [OPTICS]) du paramètre Clustering Method (Méthode d’agrégation), la période temporelle de chaque point peut être spécifiée via le paramètre Time Field (Champ temporel). Si ce paramètre est spécifié, l’outil recherche les agrégats de points proches les uns des autres dans l’espace et le temps. Le paramètre Search Time Interval (Intervalle temporel de recherche) doit être spécifié pour déterminer si un point est assez proche dans le temps d’un agrégat pour y être inclus.
Pour l’option Defined distance (DBSCAN) (Distance définie [DBSCAN]), lors de la recherche de membres d’agrégat, la valeur du paramètre Minimum Features per Cluster (Nombre minimal d’entités par agrégat) doit figurer dans les valeurs Search Distance (Distance de recherche) et Search Time Interval (Intervalle temporel de recherche) pour former un agrégat.
Pour l’option Multi-scale (OPTICS) (Multi-échelles [OPTICS]), tous les points figurant en dehors de la valeur Search Time Interval (Intervalle temporel de recherche) sont exclus lorsque le point calcule sa distance principale, recherche toutes les distances voisines dans la valeur Search Distance (Distance de recherche) spécifiée et calcule la distance d’accès.
Lorsque la valeur du paramètre Time Field (Champ temporel) est spécifiée, la classe d’entités en sortie comprend un diagramme de période par agrégat qui affiche l’intervalle temporel de chaque agrégat spatio-temporel. Quatre champs supplémentaires sont également inclus :
Mean Time,Start Time,End TimeetTime Exaggeration. La classe d’entités en sortie est temporelle et il est recommandé de définir l’heure dans le champMean Time, afin de pouvoir visualiser les agrégats dans le temps à l’aide du curseur temporel(../../help/mapping/time/visualize-temporal-data-using-the-time-slider.md). Il est également possible d’afficher le modèle spatio-temporel dans une scène 3D en définissant le champTime Exaggerationcomme élévation d’entité.Le paramètre Search Time Interval (Intervalle temporel de recherche) ne contrôle pas l’intervalle temporel global des agrégats spatio-temporels résultants. Par exemple, utiliser un intervalle temporel de recherche de 3 jours peut résulter dans un agrégat qui contient des points englobant 10 jours ou plus. En effet, l’intervalle temporel de recherche n’est utilisé que pour déterminer si un point unique est compris dans un agrégat. En formant des agrégats de plusieurs points, l’intervalle temporel global de l’agrégat peut être plus grand que l’intervalle temporel de recherche. Ce scénario s’apparente au scénario où un agrégat spatial peut être plus grand que la valeur Search Distance (Distance de recherche), à condition que chaque point possède des voisins dans l’agrégat qui sont plus proches que la distance de recherche.
Lorsque les valeurs Input Features (Entités en entrée) ne sont pas projetées (c’est-à-dire, lorsque les coordonnées sont exprimées en degrés, minutes et secondes) ou que le système de coordonnées en sortie est un système de coordonnées géographiques, les distances sont calculées à l’aide des mesures à la corde. Les mesures de distance à la corde sont utilisées, car elles sont rapides à calculer et produisent des évaluations fiables des distances géodésiques réelles, du moins pour les points se trouvant à environ 30 degrés les uns des autres. Les distances de corde reposent sur un sphéroïde aplati. Si l’on prend deux points sur la surface de la Terre, la distance de corde qui les sépare est la longueur d’une ligne qui traverse la Terre en trois dimensions pour relier ces deux points. Les distances à la corde sont exprimées en mètres.
Attention :
Il est recommandé de projeter les données, notamment si la zone d’étude s’étend au-delà de 30 degrés. Les distances à la corde ne constituent pas une bonne estimation des distance géodésiques au-delà de 30 degrés.
Cet outil prend en charge l’élévation dans ses calculs. Si les entités ponctuelles en entrée sont des entités 3D (contenant des valeurs z), la valeur du paramètre Search Distance (Distance de recherche) est la distance tridimensionnelle et les entités en sortie sont également des entités 3D.
Cet outil prend en charge le traitement parallèle et utilise 50 pour cent des processeurs disponibles par défaut. Le nombre de processeurs utilisés peut être augmenté ou réduit à l’aide de l’environnement Parallel Processing Factor (Facteur de traitement parallèle).
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Entités points en entrée |
Entités ponctuelles pour lesquelles une agrégation basée sur la densité est effectuée. |
Feature Layer |
|
Entités en sortie |
Classe d’entités en sortie recevant les agrégats finals. |
Feature Class |
|
Méthode d’agrégation |
Spécifie la méthode utilisée pour définir les agrégats.
|
String |
|
Nombre minimal d’entités par agrégat |
Nombre minimal de points à considérer comme un agrégat. Un agrégat dont le nombre de points est inférieur au nombre indiqué est considéré comme du bruit. |
Long |
|
Distance de recherche (Facultatif) |
Distance maximale à considérer. Pour l’option Defined distance (DBSCAN) (Distance définie [DBSCAN]) du paramètre Clustering Method (Méthode d’agrégation), la valeur du paramètre Minimum Features per Cluster (Nombre minimum d’entités par agrégat) doit figurer dans cette distance pour l’appartenance à l’agrégat. Les agrégats sont, au minimum, à cette distance les uns des autres. Si un point se trouve au-delà de cette distance par rapport au point le plus proche dans l’agrégat, il n’est pas inclus dans l’agrégat. Pour l’option Multi-scale (OPTICS) (Multi-échelles [OPTICS]) du paramètre Clustering Method (Méthode d’agrégation), ce paramètre est facultatif et est utilisé comme distance de recherche maximale lors de la création du diagramme d’accès. Pour l’algorithme OPTICS, le diagramme d’accès, combiné à la valeur du paramètre Cluster Sensitivity (Sensibilité de l’agrégat), détermine l’appartenance à l’agrégat. Si aucune distance n’est spécifiée, l’outil doit rechercher toutes les distances, ce qui augmente le temps de traitement. Si aucune valeur n’est indiquée, la distance par défaut utilisée correspond à la distance principale la plus élevée dans le jeu de données, en excluant les distances principales figurant dans le 1 pour cent supérieur (les distances principales les plus extrêmes). Si la valeur du paramètre Time Field (Champ temporel) est spécifiée, une distance de recherche doit être indiquée et ne comprend pas de valeur par défaut. |
Linear Unit |
|
Sensibilité de l’agrégat |
Un entier entre 0 et 100 déterminant la densité des agrégats. Un nombre proche de 100 entraîne un plus grand nombre d’agrégats denses. Un nombre proche de 0 entraîne un moins grand nombre d’agrégats moins compacts. Si aucune valeur n’est indiquée, l’outil trouve une valeur de sensibilité à l’aide de la divergence de Kullback-Leibler qui recherche la valeur lorsque l’ajout d’agrégats supplémentaires n’ajoute pas d’informations supplémentaires. |
Long |
|
Time Field (Champ temporel) |
Le champ contenant l'horodatage pour chaque enregistrement du jeu de données. Ce champ doit être de type Date. Si un champ est spécifié, l’outil recherche les agrégats de points proches les uns des autres dans l’espace et le temps. La valeur du paramètre Search Time Interval (Intervalle temporel de recherche) doit être spécifiée pour déterminer si un point est assez proche dans le temps d’un agrégat pour y être inclus. |
Field |
|
Intervalle temporel de recherche |
Intervalle temporel de recherche allant être utilisé pour déterminer si les points forment un agrégat spatio-temporel. L’intervalle temporel de recherche s’étend avant et après la période temporelle de chaque point. Par exemple, un intervalle de 3 jours autour d’un point comprend tous les points commençant 3 jours avant et se terminant 3 jours après la période temporelle du point.
L’intervalle temporel de recherche ne contrôle pas l’intervalle temporel global des agrégats spatio-temporels résultants. L’intervalle temporel de points dans un agrégat peut être plus grand que l’intervalle temporel de recherche à condition que chaque point possède des voisins dans l’agrégat qui se trouvent dans l’intervalle temporel de recherche. |
Time Unit |
Environnements
Système de coordonnées en sortie, Valeurs Z en sortie, Facteur de traitement parallèle
Informations de licence
- Basic: Oui
- Standard: Oui
- Advanced: Oui
Rubriques connexes
- Aperçu du jeu d’outils Mapping Clusters (Appariement d'agrégats)
- Fonctionnement de l’outil Density-based Clustering (Agrégation basée sur la densité)
- Fonctionnement de Spatially Constrained Multivariate Clustering (Agrégation multivariée spatialement contrainte)
- Fonctionnement de Multivariate Clustering (Agrégation multivariée)
- Détection de points spatiaux aberrants
- Rechercher un outil de géotraitement