Skip to main content

Analyse des points aberrants locaux (Outils d'exploration des modèles spatio-temporels)

Résumé

Identifie les agrégats et points aberrants statistiquement significatifs dans l’espace et le temps. Cet outil est une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin).

En savoir plus sur le fonctionnement de l’outil Analyse des valeurs aberrantes locales

Illustration

Illustration de l’outil Analyse des valeurs aberrantes locales

Utilisation

  • Cet outil accepte les fichiers netCDF créés par divers outils de la boîte à outils Exploration des modèles spatio-temporels.

    En savoir plus sur la création d’un cube spatio-temporel

  • Chaque groupe dans le cube spatio-temporel présente une valeur LOCATION_ID, une valeur time_step_ID et une valeur COUNT, ainsi que les champs Summary Fields (Champs de récapitulation) ou les Variables qui ont été inclus lors de la création du cube. Les groupes associés à la même localisation physique partagent le même ID de localisation et constituent ensemble une série chronologique. Les groupes associés au même intervalle temporel partagent le même ID d’intervalle temporel et constituent ensemble une tranche temporelle. La valeur de nombre de chaque groupe représente le nombre d’incidents ou d’enregistrements présents à la localisation associée dans l’intervalle temporel associé.

    Chaque groupe est associé à un ID de localisation, un ID d’intervalle temporel et un nombre

  • Cet outil analyse une variable indiquée pour le paramètre Input Space Time Cube (Cube spatio-temporel en entrée) netCDF à l’aide d’une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin).

  • Les entités indiquées dans Output Features (Entités en sortie) sont ajoutées à la fenêtre Contents (Contenu) avec un rendu qui résume les résultats de l’analyse spatio-temporelle pour toutes les localisations analysées. Si vous spécifiez le paramètre Polygon Analysis Mask (Masque d’analyse surfacique), les localisations analysées sont celles qui figurent dans le masque d’analyse. Sinon, les localisations analysées sont celles qui présentent au moins un point pour au moins un intervalle temporel.

    Localisations du cube avec et sans données

  • Outre l’option Output Features (Entités en sortie), un résumé de l’analyse est généré sous forme de messages apparaissant en bas de la fenêtre Geoprocessing (Géotraitement) lorsque l’outil est exécuté. Vous pouvez accéder aux messages en survolant la barre de progression, en cliquant sur le bouton de menu contextuel ou en développant la section des détails des messages dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également accéder aux messages d’un outil précédemment exécuté via Geoprocessing History (Historique de géotraitement) dans la fenêtre Catalog (Catalogue).

  • L’outil Analyse des valeurs aberrantes locales identifie les agrégats et valeurs aberrantes statistiquement significatifs dans l’espace et le temps. Reportez-vous à la section Fonctionnement de l’outil Analyse des valeurs aberrantes locales pour accéder aux définitions des catégories en sortie par défaut et obtenir des informations supplémentaires sur les algorithmes utilisés par cet outil d’analyse.

  • Pour identifier les agrégats et valeurs aberrantes au sein du cube spatio-temporel, cet outil utilise une implémentation spatio-temporelle de la statistique Indice local de Moran (Anselin), qui tient compte de la valeur de chaque groupe dans le contexte des valeurs des groupes voisins.

  • Pour déterminer les groupes à inclure dans chaque voisinage d’analyse, l’outil identifie d’abord les groupes voisins inclus dans la valeur spécifiée dans Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales). Ensuite, pour chacun de ces groupes, il inclut les groupes se trouvant aux mêmes localisations séparés par N intervalles temporels précédents, N représentant la valeur Neighborhood Time Step (Intervalle temporel de voisinage) que vous spécifiez.

  • Le choix du paramètre Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales) doit refléter les relations inhérentes entre les entités que vous analysez. Plus la modélisation des interactions entre les entités dans l’espace est réaliste, plus les résultats sont précis. Des recommandations sont présentées dans la section Sélection d’une conceptualisation des relations spatiales : bonnes pratiques.

  • La valeur par défaut du paramètre Conceptualization of Spatial Relationships (conceptualisation des relations spatiales) est Fixed distance (Distance fixe). Un groupe est considéré comme voisin lorsque son centroïde se trouve dans la distance spécifiée dans Neighborhood Distance (Distance de voisinage) et que son intervalle temporel est compris dans la valeur spécifiée pour Neighborhood Time Step (Intervalle temporel de voisinage). Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Distance (Distance de voisinage), une valeur est calculée pour vous en fonction de la distribution spatiale des données ponctuelles. Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Time Step (Intervalle temporel de voisinage), l’outil utilise une valeur par défaut, à savoir 1 intervalle temporel.

Le paramètre Number of Neighbors (Nombre de voisins) peut remplacer le paramètre Neighborhood Distance (Distance de voisinage) pour l’option Fixed distance (Distance fixe) ou étendre la recherche de voisinage pour les options Contiguity edges only (Segments de contiguïté uniquement) et Contiguity edges corners (Angles des segments de contiguïté). Dans ce cas, Number of Neighbors (Nombre de voisins) est utilisé comme nombre minimal. Par exemple, si vous spécifiez Fixed distance (Distance fixe) avec une valeur Neighborhood Distance (Distance de voisinage) de 10 miles et la valeur 3 pour le paramètre Number of Neighbors (Nombre de voisins), tous les groupes reçoivent un minimum de 3 voisins spatiaux même si la valeur Neighborhood Distance (Distance de voisinage) doit être augmentée pour les détecter. La distance est augmentée uniquement pour les groupes dans lesquels la valeur minimale de Number of Neighbors (Nombre de voisins) n’est pas satisfaite. De même, avec les options de contiguïté, pour les groupes dont le nombre de voisins contigus est inférieur au nombre spécifié, des voisins supplémentaires sont choisis en fonction de la proximité avec le centroïde.

– La valeur du paramètre Neighborhood Time Step (Intervalle temporel de voisinage) représente le nombre d’intervalles temporels à inclure dans le voisinage d’analyse. Si, par exemple, l’intervalle temporel du cube est de trois mois et que vous indiquez 2 comme valeur pour Neighborhood Time Step (Intervalle temporel de voisinage), le nombre total de groupes compris dans la valeur spécifiée pour Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales), ainsi que tous les groupes associés pour les deux intervalles temporels précédents (représentant une période de neuf mois) sont inclus dans le voisinage d’analyse.

  • Les permutations permettent de déterminer la probabilité de trouver la distribution spatiale réelle des valeurs que vous analysez. Pour chaque permutation, les valeurs voisines autour de chaque groupe sont réorganisées de manière aléatoire et la valeur l de l’indice local d’Anselin Moran est calculée. Le résultat est une distribution de référence des valeurs qui est ensuite comparée à l’indice de Moran réel observé pour déterminer la probabilité que la valeur observée se trouve dans la distribution aléatoire. La valeur par défaut est de 499 permutations. Cependant, vous pouvez améliorer la distribution aléatoire en augmentant le nombre de permutations, ce qui augmente la précision de la pseudo valeur p.

– Si le paramètre Number of Permutations (Nombre de permutations) est défini sur 0, le résultat est une valeur p classique et non une pseudo valeur p.

  • Les permutations employées par cet outil tirent parti des performances accrues disponibles dans les systèmes équipés de plusieurs processeurs (ou de processeurs multicœurs). L’outil est exécuté par défaut avec 50 pour cent des processeurs disponibles. Toutefois, le nombre de processeurs peut être augmenté ou réduit à l’aide de l’environnement Parallel Processing Factor (Facteur de traitement parallèle). La vitesse de traitement optimisée se remarque davantage dans les cubes spatio-temporels plus volumineux ou lors de l’exécution de l’outil avec un nombre plus important de permutations.

  • La couche d’entités Polygon Analysis Mask (Masque d’analyse surfacique) peut inclure un ou plusieurs polygones qui définissent la zone d’étude de l’analyse. Ces polygones doivent indiquer l’endroit où les entités ponctuelles risquent d’être présentes et exclure les zones où les points ne risquent pas d’apparaître. Si, par exemple, vous analysez les tendances en matière de cambriolage d’habitations, vous pouvez utiliser le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) pour exclure un lac étendu, des parcs régionaux ou d’autres zones ne comprenant aucune habitation.

  • Le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) est intersecté avec l’étendue du paramètre Input Space Time Cube (Cube spatio-temporel en entrée) et n’étend pas les dimensions du cube.

  • Si le masque indiqué dans le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) que vous utilisez pour définir la zone d’étude couvre une surface qui s’étend au-delà de l’étendue des entités en entrée qui ont servi lors de la création initiale du cube, vous pouvez recréer le cube en utilisant la valeur de Polygon Analysis Mask (Masque d’analyse surfacique) comme environnement Extent (Étendue). Cette opération permet de s’assurer que toute la surface couverte par le paramètre Polygon Analysis Mask (Masque d’analyse surfacique) est incluse dans l’outil Analyse des valeurs aberrantes locales. L’utilisation du paramètre Polygon Analysis Mask (Masque d’analyse surfacique) comme paramètre d’environnement Extent (Étendue) lors de la création du cube permet de s’assurer que l’étendue du cube correspond à l’étendue du masque Polygon Analysis Mask (Masque d’analyse surfacique).

  • Cet outil crée une nouvelle classe d’entités en sortie comportant les attributs suivants pour chaque localisation du cube spatio-temporel. Ces champs peuvent être utilisés pour une visualisation personnalisée de la sortie. Pour plus d’informations sur les autres résultats d’analyse, reportez-vous à la rubrique Fonctionnement de l’outil Analyse des valeurs aberrantes locales.

    • Number of Outliers

    • Percentage of Outliers

    • Number of Low Clusters

    • Percentage of Low Clusters

    • Number of Low Outliers

    • Percentage of Low Outliers

    • Number of High Clusters

    • Percentage of High Clusters

    • Number of High Outliers

    • Percentage of High Outliers

    • localisations sans No Spatial Neighbors

    • localisations avec Outlier in the Most Recent Time Step

    • Cluster Outlier Type

    • et résumés statistiques complémentaires

  • Le champ Cluster Outlier Type indique toujours les agrégats et points aberrants statistiquement significatifs pour un niveau de confiance de 95 % et seuls les groupes statistiquement significatifs contiennent des valeurs dans ce champ. Cette signification reflète une correction FDR (False Discovery Rate).

  • Le rendu par défaut pour Output Feature Class (Classe d’entités en sortie) repose sur le champ CO_TYPE et indique les localisations statistiquement significatives. Il présente les localisations ayant fait partie d’un agrégat élevé-élevé, d’un point aberrant élevé-faible, d’un point aberrant faible-élevé ou d’un agrégat faible-faible, ou classées en tant que Types multiples au fil du temps.

  • Pour garantir que chaque localisation possède au moins un voisin temporel, l’indice local de Moran n’est pas calculé pour la première tranche temporelle. Les valeurs de groupe de la première tranche horaire sont cependant incluses dans le calcul de la moyenne globale.

  • L’exécution de l’outil Analyse des valeurs aberrantes locales ajoute les résultats d’analyse dans le cube spécifié dans Input Space Time Cube (Cube spatio-temporel en entrée) netCDF. Chaque groupe est analysé par rapport aux groupes voisins pour mesurer l’agrégation des valeurs élevées et faibles et afin d’identifier les éventuelles valeurs aberrantes spatiales et temporelles au sein de ces agrégats. Le résultat de cette analyse est un indice local de Moran, une pseudo valeur p (ou une valeur p si aucune permutation n’a été utilisée) et un type d’agrégat ou de valeur aberrante (CO_TYPE) pour chaque groupe du cube spatio-temporel.

    Vous trouverez ci-dessous un récapitulatif des variables ajoutées dans Input Space Time Cube (Cube spatio-temporel en entrée) :

    Nom de variable

    Description

    Dimension

    OUTLIER_{ANALYSIS_VARIABLE}_INDEX

    Indice local de Moran calculé.

    Trois dimensions : une valeur d’indice local de Moran pour chaque groupe du cube spatio-temporel.

    OUTLIER_{ANALYSIS_VARIABLE}_PVALUE

    Pseudo valeur p ou valeur p de la statistique Indice local de Moran (Anselin) qui mesure la signification statistique de la valeur de l’indice local de Moran.

    Trois dimensions : une valeur p ou pseudo valeur p pour chaque groupe du cube spatio-temporel.

    OUTLIER_{ANALYSIS_VARIABLE}_TYPE

    Le type de catégorie de résultats fait la distinction entre une grappe statistiquement significative de valeurs élevées (élevé-élevé), une grappe de valeurs faibles (faible-faible), un point aberrant dans lequel une valeur élevée est entourée principalement de valeurs faibles (élevé-faible) et un point aberrant dans lequel une valeur faible est entourée principalement de valeurs élevées (faible-élevé).

    Tridimensionnel : un type d’agrégat ou de point aberrant pour chaque groupe du cube spatio-temporel. Ce groupe est basé sur une correction FDR.

    OUTLIER_{ANALYSIS_VARIABLE}_HAS_SPATIAL_NEIGHBORS

    Indique les localisations qui ont des voisins spatiaux et celles qui s’appuient uniquement sur des voisins temporels.

    Deux dimensions : une classification pour chaque localisation. L’analyse des localisations qui n’ont pas de voisins spatiaux génère des calculs reposant uniquement sur des voisins temporels.

    OUTLIER_{ANALYSIS_VARIABLE}_ZTRAN

    Score z, qui correspond au nombre d’écarts types duquel la valeur dévie de la moyenne.

    Tridimensionnel : un score z pour chaque groupe du cube spatio-temporel.

    OUTLIER_{ANALYSIS_VARIABLE}_LAG

    La valeur de décalage spatial.

    Tridimensionnel : une valeur de décalage spatial pour chaque groupe du cube spatio-temporel.

Paramètres

Etiqueter Explication Type de données

Cube spatio-temporel en entrée

Le cube spatio-temporel contenant la variable à analyser. Les cubes spatio-temporels présentent une extension de fichier .nc et sont créés à l’aide de divers outils de la boîte à outils Exploration des modèles spatio-temporels.

File

Variable d'analyse

Variable numérique dans le fichier netCDF que vous voulez analyser.

String

Entités en sortie

Classe d’entités en sortie contenant les localisations ayant été considérées comme des agrégats ou points aberrants statistiquement significatifs.

Feature Class

Distance du voisinage

(Facultatif)

Etendue spatiale du voisinage d’analyse. Cette valeur désigne les entités qui sont analysées ensemble pour évaluer l’agrégation spatio-temporelle locale.

Linear Unit

Intervalle temporel de voisinage

Nombre d’intervalles temporels à inclure dans le voisinage d’analyse. Cette valeur désigne les entités qui sont analysées ensemble pour évaluer l’agrégation spatio-temporelle locale.

Long

Nombre de permutations

(Facultatif)

Nombre de permutations aléatoires pour le calcul des pseudo valeurs p. Le nombre de permutations par défaut est 499. Si vous choisissez 0 permutation, la valeur p standard est calculée.

  • 0Les permutations ne sont pas utilisées et une valeur p standard est calculée.

  • 99Avec 99 permutations, la pseudo valeur p la plus petite possible est 0,01 et toutes les autres pseudo valeurs p sont des multiples pairs de cette valeur.

  • 199Avec 199 permutations, la pseudo valeur p la plus petite possible est 0,005 et toutes les autres pseudo valeurs p sont des multiples pairs de cette valeur.

  • 499Avec 499 permutations, la pseudo valeur p la plus petite possible est 0,002 et toutes les autres pseudo valeurs p sont des multiples pairs de cette valeur.

  • 999Avec 999 permutations, la pseudo valeur p la plus petite possible est 0,001 et toutes les autres pseudo valeurs p sont des multiples pairs de cette valeur.

  • 9999Avec 9 999 permutations, la pseudo valeur p la plus petite possible est 0,0001 et toutes les autres pseudo valeurs p sont des multiples pairs de cette valeur.

Long

Masque d’analyse surfacique

(Facultatif)

Couche d’entités surfaciques dont un ou plusieurs polygones définissent la zone d’étude de l’analyse. Un masque d’analyse surfacique permet, par exemple, d’exclure un lac de grande envergure de l’analyse. Les groupes définis dans le paramètre Input Space Time Cube (Cube spatio-temporel) en entrée qui se situent en dehors du masque ne sont pas inclus dans l’analyse.

Ce paramètre est uniquement disponible pour les cubes de grille.

Feature Layer

Conceptualisation de relations spatiales

(Facultatif)

Indique comment les relations spatiales entre les entités sont définies.

  • Distance fixeChaque groupe est analysé par rapport aux groupes voisins. Les groupes voisins situés dans la distance critique spécifiée (Neighborhood Distance [Distance de voisinage]) reçoivent une pondération de 1 et exercent une influence sur les calculs du groupe cible. Les groupes voisins situés au-delà de la distance critique reçoivent une pondération de zéro et n’exercent aucune influence sur les calculs du groupe cible.

  • K voisins les plus prochesLes k groupes les plus proches sont inclus dans l’analyse, k étant un paramètre numérique spécifié.

  • Tronçons de contiguïté uniquementSeuls les groupes voisins qui partagent un segment influencent les calculs du groupe surfacique cible.

  • Angles des tronçons de contiguïtéLes groupes voisins qui partagent un segment ou un nœud influencent les calculs du groupe surfacique cible.

String

Nombre de voisins spatiaux

(Facultatif)

Entier spécifiant le nombre minimal ou exact de voisins à inclure dans les calculs du groupe cible. Pour K nearest neighbors (K voisins les plus proches), chaque groupe comporte exactement ce nombre spécifié de voisins. Pour Fixed distance (Distance fixe), chaque groupe comporte au moins ce nombre de voisins (le paramètre Neighborhood Distance [Distance de voisinage] est temporairement étendu pour garantir ce nombre de voisins, le cas échéant). Si l’une des conceptualisations de contiguïté est sélectionnée, ce nombre minimal de voisins est attribué à chaque groupe. Pour les groupes dont le nombre de voisins contigus est inférieur à celui spécifié, les voisins supplémentaires reposeront sur la proximité avec le centroïde des entités.

Long

Définir la fenêtre globale

(Facultatif)

La statistique Indice local de Moran (Anselin) compare une statistique locale, calculée d’après les voisins de chaque groupe, à une valeur globale. Ce paramètre permet de contrôler les groupes à utiliser pour calculer la valeur globale.

  • Cube entierChaque voisinage est analysé en le comparant au cube entier. Il s’agit de l’option par défaut.

  • Intervalle temporel de voisinageChaque voisinage est analysé par comparaison avec les groupes contenus dans l’intervalle temporel spécifié dans Neighborhood Time Step (Intervalle temporel de voisinage).

  • Intervalle temporel individuelChaque voisinage est analysé par comparaison avec les groupes du même intervalle temporel.

String

Environnements

Espace de travail courant, Espace de travail temporaire, Système de coordonnées en sortie, Transformations géographiques, Générateur de nombres aléatoires, Facteur de traitement parallèle

Cas particuliers

Générateur de nombres aléatoires

The Random Generator Type used is always Mersenne Twister.

Informations de licence

  • Basic: Oui
  • Standard: Oui
  • Advanced: Oui