Analyse des points aberrants locaux (Outils d'exploration des modèles spatio-temporels)
Résumé
Identifie les agrégats et points aberrants statistiquement significatifs dans l’espace et le temps. Cet outil est une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin).
En savoir plus sur le fonctionnement de l’outil Analyse des valeurs aberrantes locales
Illustration

Utilisation
Cet outil accepte les fichiers netCDF créés par divers outils de la boîte à outils Exploration des modèles spatio-temporels.
Chaque groupe dans le cube spatio-temporel présente une valeur
LOCATION_ID, une valeurtime_step_IDet une valeurCOUNT, ainsi que les champs Summary Fields (Champs de récapitulation) ou les Variables qui ont été inclus lors de la création du cube. Les groupes associés à la même localisation physique partagent le même ID de localisation et constituent ensemble une série chronologique. Les groupes associés au même intervalle temporel partagent le même ID d’intervalle temporel et constituent ensemble une tranche temporelle. La valeur de nombre de chaque groupe représente le nombre d’incidents ou d’enregistrements présents à la localisation associée dans l’intervalle temporel associé.
Cet outil analyse une variable indiquée pour le paramètre Input Space Time Cube (Cube spatio-temporel en entrée) netCDF à l’aide d’une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin).
Les entités indiquées dans Output Features (Entités en sortie) sont ajoutées à la fenêtre Contents (Contenu) avec un rendu qui résume les résultats de l’analyse spatio-temporelle pour toutes les localisations analysées. Si vous spécifiez le paramètre Polygon Analysis Mask (Masque d’analyse surfacique), les localisations analysées sont celles qui figurent dans le masque d’analyse. Sinon, les localisations analysées sont celles qui présentent au moins un point pour au moins un intervalle temporel.

Outre l’option Output Features (Entités en sortie), un résumé de l’analyse est généré sous forme de messages apparaissant en bas de la fenêtre Geoprocessing (Géotraitement) lorsque l’outil est exécuté. Vous pouvez accéder aux messages en survolant la barre de progression, en cliquant sur le bouton de menu contextuel
ou en développant la section des détails des messages dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également accéder aux messages d’un outil précédemment exécuté via Geoprocessing History (Historique de géotraitement) dans la fenêtre Catalog (Catalogue).L’outil Analyse des valeurs aberrantes locales identifie les agrégats et valeurs aberrantes statistiquement significatifs dans l’espace et le temps. Reportez-vous à la section Fonctionnement de l’outil Analyse des valeurs aberrantes locales pour accéder aux définitions des catégories en sortie par défaut et obtenir des informations supplémentaires sur les algorithmes utilisés par cet outil d’analyse.
Pour identifier les agrégats et valeurs aberrantes au sein du cube spatio-temporel, cet outil utilise une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin), qui tient compte de la valeur de chaque groupe dans le contexte des valeurs des groupes voisins.
Pour déterminer les groupes à inclure dans chaque voisinage d’analyse, l’outil identifie d’abord les groupes voisins inclus dans la valeur spécifiée dans Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales). Ensuite, pour chacun de ces groupes, il inclut les groupes se trouvant aux mêmes localisations séparés par N intervalles temporels précédents, N représentant la valeur Neighborhood Time Step (Intervalle temporel de voisinage) que vous spécifiez.
Le choix du paramètre Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales) doit refléter les relations inhérentes entre les entités que vous analysez. Plus la modélisation des interactions entre les entités dans l’espace est réaliste, plus les résultats sont précis. Des recommandations sont présentées dans la section Sélection d’une conceptualisation des relations spatiales : bonnes pratiques.
La valeur par défaut du paramètre Conceptualization of Spatial Relationships (conceptualisation des relations spatiales) est Fixed distance (Distance fixe). Un groupe est considéré comme voisin lorsque son centroïde se trouve dans la distance spécifiée dans Neighborhood Distance (Distance de voisinage) et que son intervalle temporel est compris dans la valeur spécifiée pour Neighborhood Time Step (Intervalle temporel de voisinage). Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Distance (Distance de voisinage), une valeur est calculée pour vous en fonction de la distribution spatiale des données ponctuelles. Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Time Step (Intervalle temporel de voisinage), l’outil utilise une valeur par défaut, à savoir 1 intervalle temporel.
Le paramètre Number of Neighbors (Nombre de voisins) peut remplacer le paramètre Neighborhood Distance (Distance de voisinage) pour l’option Fixed distance (Distance fixe) ou étendre la recherche de voisinage pour les options Contiguity edges only (Segments de contiguïté uniquement) et Contiguity edges corners (Angles des segments de contiguïté). Dans ce cas, Number of Neighbors (Nombre de voisins) est utilisé comme nombre minimal. Par exemple, si vous spécifiez Fixed distance (Distance fixe) avec une valeur Neighborhood Distance (Distance de voisinage) de 10 miles et la valeur 3 pour le paramètre Number of Neighbors (Nombre de voisins), tous les groupes reçoivent un minimum de 3 voisins spatiaux même si la valeur Neighborhood Distance (Distance de voisinage) doit être augmentée pour les détecter. La distance est augmentée uniquement pour les groupes dans lesquels la valeur minimale de Number of Neighbors (Nombre de voisins) n’est pas satisfaite. De même, avec les options de contiguïté, pour les groupes dont le nombre de voisins contigus est inférieur au nombre spécifié, des voisins supplémentaires sont choisis en fonction de la proximité avec le centroïde.
– La valeur du paramètre Neighborhood Time Step (Intervalle temporel de voisinage) représente le nombre d’intervalles temporels à inclure dans le voisinage d’analyse. Si, par exemple, l’intervalle temporel du cube est de trois mois et que vous indiquez 2 comme valeur pour Neighborhood Time Step (Intervalle temporel de voisinage), le nombre total de groupes compris dans la valeur spécifiée pour Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales), ainsi que tous les groupes associés pour les deux intervalles temporels précédents (représentant une période de neuf mois) sont inclus dans le voisinage d’analyse.
- Les permutations permettent de déterminer la probabilité de trouver la distribution spatiale réelle des valeurs que vous analysez. Pour chaque permutation, les valeurs voisines autour de chaque groupe sont réorganisées de manière aléatoire et la valeur l de l’indice local d’Anselin Moran est calculée. Le résultat est une distribution de référence des valeurs qui est ensuite comparée à l’indice de Moran réel observé pour déterminer la probabilité que la valeur observée se trouve dans la distribution aléatoire. La valeur par défaut est de 499 permutations. Cependant, vous pouvez améliorer la distribution aléatoire en augmentant le nombre de permutations, ce qui augmente la précision de la pseudo valeur p.
– Si le paramètre Number of Permutations (Nombre de permutations) est défini sur 0, le résultat est une valeur p classique et non une pseudo valeur p.
Les permutations employées par cet outil tirent parti des performances accrues disponibles dans les systèmes équipés de plusieurs processeurs (ou de processeurs multicœurs). L’outil est exécuté par défaut avec 50 pour cent des processeurs disponibles. Toutefois, le nombre de processeurs peut être augmenté ou réduit à l’aide de l’environnement Parallel Processing Factor (Facteur de traitement parallèle). La vitesse de traitement optimisée se remarque davantage dans les cubes spatio-temporels plus volumineux ou lors de l’exécution de l’outil avec un nombre plus important de permutations.
La couche d’entités Polygon Analysis Mask (Masque d’analyse surfacique) peut inclure un ou plusieurs polygones qui définissent la zone d’étude de l’analyse. Ces polygones doivent indiquer l’endroit où les entités ponctuelles risquent d’être présentes et exclure les zones où les points ne risquent pas d’apparaître. Si, par exemple, vous analysez les tendances en matière de cambriolage d’habitations, vous pouvez utiliser le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) pour exclure un lac étendu, des parcs régionaux ou d’autres zones ne comprenant aucune habitation.
Le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) est intersecté avec l’étendue du paramètre Input Space Time Cube (Cube spatio-temporel en entrée) et n’étend pas les dimensions du cube.
Si le masque indiqué dans le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) que vous utilisez pour définir la zone d’étude couvre une surface qui s’étend au-delà de l’étendue des entités en entrée qui ont servi lors de la création initiale du cube, vous pouvez recréer le cube en utilisant la valeur de Polygon Analysis Mask (Masque d’analyse surfacique) comme environnement Extent (Étendue). Cette opération permet de s’assurer que toute la surface couverte par le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) est incluse dans l’outil Analyse des valeurs aberrantes locales. L’utilisation du paramètre Polygon Analysis Mask (Masque d’analyse surfacique) comme paramètre d’environnement Extent (Étendue) lors de la création du cube permet de s’assurer que l’étendue du cube correspond à l’étendue du masque Polygon Analysis Mask (Masque d’analyse surfacique).
Cet outil crée une nouvelle classe d’entités en sortie comportant les attributs suivants pour chaque localisation du cube spatio-temporel. Ces champs peuvent être utilisés pour une visualisation personnalisée de la sortie. Pour plus d’informations sur les autres résultats d’analyse, reportez-vous à la rubrique Fonctionnement de l’outil Analyse des valeurs aberrantes locales.
Number of OutliersPercentage of OutliersNumber of Low ClustersPercentage of Low ClustersNumber of Low OutliersPercentage of Low OutliersNumber of High ClustersPercentage of High ClustersNumber of High OutliersPercentage of High Outlierslocalisations sans
No Spatial Neighborslocalisations avec
Outlier in the Most Recent Time StepCluster Outlier Typeet résumés statistiques complémentaires
Le champ
Cluster Outlier Typeindique toujours les agrégats et points aberrants statistiquement significatifs pour un niveau de confiance de 95 % et seuls les groupes statistiquement significatifs contiennent des valeurs dans ce champ. Cette signification reflète une correction FDR (False Discovery Rate).Le rendu par défaut pour Output Feature Class (Classe d’entités en sortie) repose sur le champ
CO_TYPEet indique les localisations statistiquement significatives. Il présente les localisations ayant fait partie d’un agrégat élevé-élevé, d’un point aberrant élevé-faible, d’un point aberrant faible-élevé ou d’un agrégat faible-faible, ou classées en tant que Types multiples au fil du temps.Pour garantir que chaque localisation possède au moins un voisin temporel, l’indice local de Moran n’est pas calculé pour la première tranche temporelle. Les valeurs de groupe de la première tranche horaire sont cependant incluses dans le calcul de la moyenne globale.
L’exécution de l’outil Analyse des valeurs aberrantes locales ajoute les résultats d’analyse dans le cube spécifié dans Input Space Time Cube (Cube spatio-temporel en entrée) netCDF. Chaque groupe est analysé par rapport aux groupes voisins pour mesurer l’agrégation des valeurs élevées et faibles et afin d’identifier les éventuelles valeurs aberrantes spatiales et temporelles au sein de ces agrégats. Le résultat de cette analyse est un indice local de Moran, une pseudo valeur p (ou une valeur p si aucune permutation n’a été utilisée) et un type d’agrégat ou de valeur aberrante (
CO_TYPE) pour chaque groupe du cube spatio-temporel.Vous trouverez ci-dessous un récapitulatif des variables ajoutées dans Input Space Time Cube (Cube spatio-temporel en entrée) :
Nom de variable
Description
Dimension
OUTLIER_{ANALYSIS_VARIABLE}_INDEXIndice local de Moran calculé.
Trois dimensions : une valeur d’indice local de Moran pour chaque groupe du cube spatio-temporel.
OUTLIER_{ANALYSIS_VARIABLE}_PVALUEPseudo valeur p ou valeur p de la statistique Indice local de Moran (Anselin) qui mesure la signification statistique de la valeur de l’indice local de Moran.
Trois dimensions : une valeur p ou pseudo valeur p pour chaque groupe du cube spatio-temporel.
OUTLIER_{ANALYSIS_VARIABLE}_TYPELe type de catégorie de résultats fait la distinction entre une grappe statistiquement significative de valeurs élevées (élevé-élevé), une grappe de valeurs faibles (faible-faible), un point aberrant dans lequel une valeur élevée est entourée principalement de valeurs faibles (élevé-faible) et un point aberrant dans lequel une valeur faible est entourée principalement de valeurs élevées (faible-élevé).
Tridimensionnel : un type d’agrégat ou de point aberrant pour chaque groupe du cube spatio-temporel. Ce groupe est basé sur une correction FDR.
OUTLIER_{ANALYSIS_VARIABLE}_HAS_SPATIAL_NEIGHBORSIndique les localisations qui ont des voisins spatiaux et celles qui s’appuient uniquement sur des voisins temporels.
Deux dimensions : une classification pour chaque localisation. L’analyse des localisations qui n’ont pas de voisins spatiaux génère des calculs reposant uniquement sur des voisins temporels.
OUTLIER_{ANALYSIS_VARIABLE}_ZTRANScore z, qui correspond au nombre d’écarts types duquel la valeur dévie de la moyenne.
Tridimensionnel : un score z pour chaque groupe du cube spatio-temporel.
OUTLIER_{ANALYSIS_VARIABLE}_LAGLa valeur de décalage spatial.
Tridimensionnel : une valeur de décalage spatial pour chaque groupe du cube spatio-temporel.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
Cube spatio-temporel en entrée |
Le cube spatio-temporel contenant la variable à analyser. Les cubes spatio-temporels présentent une extension de fichier |
File |
|
Variable d'analyse |
Variable numérique dans le fichier netCDF que vous voulez analyser. |
String |
|
Entités en sortie |
Classe d’entités en sortie contenant les localisations ayant été considérées comme des agrégats ou points aberrants statistiquement significatifs. |
Feature Class |
|
Distance du voisinage (Facultatif) |
Etendue spatiale du voisinage d’analyse. Cette valeur désigne les entités qui sont analysées ensemble pour évaluer l’agrégation spatio-temporelle locale. |
Linear Unit |
|
Intervalle temporel de voisinage |
Nombre d’intervalles temporels à inclure dans le voisinage d’analyse. Cette valeur désigne les entités qui sont analysées ensemble pour évaluer l’agrégation spatio-temporelle locale. |
Long |
|
Nombre de permutations (Facultatif) |
Nombre de permutations aléatoires pour le calcul des pseudo valeurs p. Le nombre de permutations par défaut est 499. Si vous choisissez 0 permutation, la valeur p standard est calculée.
|
Long |
|
Masque d’analyse surfacique (Facultatif) |
Couche d’entités surfaciques dont un ou plusieurs polygones définissent la zone d’étude de l’analyse. Un masque d’analyse surfacique permet, par exemple, d’exclure un lac de grande envergure de l’analyse. Les groupes définis dans le paramètre Input Space Time Cube (Cube spatio-temporel) en entrée qui se situent en dehors du masque ne sont pas inclus dans l’analyse. Ce paramètre est uniquement disponible pour les cubes de grille. |
Feature Layer |
|
Conceptualisation de relations spatiales (Facultatif) |
Indique comment les relations spatiales entre les entités sont définies.
|
String |
|
Nombre de voisins spatiaux (Facultatif) |
Entier spécifiant le nombre minimal ou exact de voisins à inclure dans les calculs du groupe cible. Pour K nearest neighbors (K voisins les plus proches), chaque groupe comporte exactement ce nombre spécifié de voisins. Pour Fixed distance (Distance fixe), chaque groupe comporte au moins ce nombre de voisins (le paramètre Neighborhood Distance [Distance de voisinage] est temporairement étendu pour garantir ce nombre de voisins, le cas échéant). Si l’une des conceptualisations de contiguïté est sélectionnée, ce nombre minimal de voisins est attribué à chaque groupe. Pour les groupes dont le nombre de voisins contigus est inférieur à celui spécifié, les voisins supplémentaires reposeront sur la proximité avec le centroïde des entités. |
Long |
|
Définir la fenêtre globale (Facultatif) |
La statistique Indice local de Moran (Anselin) compare une statistique locale, calculée d’après les voisins de chaque groupe, à une valeur globale. Ce paramètre permet de contrôler les groupes à utiliser pour calculer la valeur globale.
|
String |
Environnements
Espace de travail courant, Espace de travail temporaire, Système de coordonnées en sortie, Transformations géographiques, Générateur de nombres aléatoires, Facteur de traitement parallèle
Cas particuliers
- Générateur de nombres aléatoires
-
The Random Generator Type used is always Mersenne Twister.
Informations de licence
- Basic: Oui
- Standard: Oui
- Advanced: Oui
Rubriques connexes
- Vue d’ensemble du jeu d’outils Analyse des modèles spatio-temporels
- Fonctionnement de l’outil Analyse des valeurs aberrantes locales
- Créer un cube spatio-temporel en agrégeant des points
- Visualiser le cube spatio-temporel
- Qu’est-ce qu’un score z ? Qu’est-ce qu’une valeur p ?
- Vue d’ensemble de la boîte à outils Exploration des modèles spatio-temporels
- Fonctionnement de l’outil Analyse des valeurs aberrantes et des agrégats (indice local de Moran [Anselin])
- Rechercher un outil de géotraitement