Fonctionnement de l’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales)
L’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales) identifie les agrégats et les points aberrantes significatifs dans vos données. Il recherche les emplacements de votre zone d’étude comportant des valeurs statistiquement différentes de leurs voisins dans l’espace et le temps. Il accepte en entrée un cube NetCDF spatio-temporel créé à l’aide de l’outil Create Space Time Cube By Aggregating Points (Créer un cube spatio-temporel en agrégeant des points) ou Create Space Time Cube From Defined Locations (Créer un cube spatio-temporel à partir d’emplacements définis). Il utilise ensuite les valeurs du paramètre Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales) pour calculer une implémentation spatio-temporelle de la statistique de l’indice local de Moran (Anselin) (Cluster and Outlier Analysis (Analyse des valeurs aberrantes et des agrégats)) pour chaque groupe. Pour ce faire, l’outil calcule un indice local de Moran, une pseudo valeur p et un code de type (CO_TYPE) représentant le type de catégorie d’agrégat ou de point aberrant pour chaque groupe statistiquement significatif dans la valeur du paramètre Input Space Time Cube (Cube spatio-temporel en entrée). Les pseudo valeurs de p représentent la signification statistique des valeurs d’indice calculées et leur précision dépend du nombre de permutations.
Applications possibles
L’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales) peut être utilisé dans de nombreux domaines, tels que l’économie, la gestion de ressources, la géographie politique, la démographie, la santé publique et la prévention des fraudes. Cet outil permet de répondre à plusieurs sortes de questions, telles que :
Certains emplacements de ma zone d'étude présentent-ils des modèles de dépense anormaux ?
Y a-t-il eu une période avec des taux anormalement élevés d’épidémies dans la zone d’étude ?
Y a-t-il des zones suburbaines au sein desquelles les habitants utilisent beaucoup plus d'eau que leurs voisins ? Vous pouvez également déterminer les zones suburbaines qui utilisent systématiquement moins d'eau afin de développer des pratiques conseillées en matière de conservation de l'eau.
Ma région comporte-t-elle des emplacements présentant des hausses significatives du nombre de déclarations de sinistres remplies au cours du dernier mois ?
Sorties de l’outil
Cet outil produit plusieurs sorties. La sortie la plus utile est une carte bidimensionnelle récapitulant chaque emplacement dans le temps, qui est ajoutée à la carte une fois l’outil exécuté. Les catégories sont les suivantes :
|
Nom de type |
Définition |
|
|---|---|---|
|
|
Never Significant (Jamais significatif) |
Emplacement n’ayant jamais connu de champ |
|
|
Only High-High Cluster (Agrégat élevé-élevé uniquement) |
Emplacement où le seul type statistiquement significatif dans le temps a été Agrégats élevé-élevé. |
|
|
Only High-Low Outlier (Point aberrant élevé-faible uniquement) |
Emplacement où le seul type statistiquement significatif dans le temps a été Points aberrants élevés-faibles. |
|
|
Only Low-High Outlier (Point aberrant faible-élevé uniquement) |
Emplacement où le seul type statistiquement significatif dans le temps a été Points aberrants faibles-élevés. |
|
|
Only Low-Low Cluster (Agrégat faible-faible uniquement) |
Emplacement où le seul type statistiquement significatif dans le temps a été Agrégats faible-faible. |
|
|
Multiple Types (Types multiples) |
Emplacement ayant connu plusieurs types d’agrégats et de points aberrants statistiquement significatifs dans le temps (par exemple, pendant certaines périodes, l’emplacement a été un point aberrant faible-élevé, et pendant d’autres périodes, il a été un agrégat élevé-élevé). |
De plus, des messages récapitulant les résultats d’analyse apparaissent en bas de la fenêtre Geoprocessing (Géotraitement) pendant l’implémentation de l’outil. Vous pouvez accéder aux messages en passant le curseur de la souris sur la barre de progression, en cliquant sur le bouton de menu contextuel
ou en développant la section de messages dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également consulter les messages provenant d'un outil déjà exécuté via l’historique de géotraitement.
Ces messages contiennent des informations sur la valeur du paramètre Input Space Time Cube (Cube spatio-temporel en entrée), telles que la période, la déformation temporelle et le nombre de groupes et d’emplacements analysés. Les messages incluent également des informations importantes sur les éventuels points aberrants de l’intervalle temporel le plus récent et récapitulent les principales phases susceptibles de présenter un intérêt. Ainsi, si vous voulez déterminer les zones les moins performantes de votre secteur de vente et que vous recherchez les points aberrants faibles-élevés, les messages vous indiquent la principale phase possédant le nombre le plus élevé de points aberrants faibles-élevés.

Cet outil crée une nouvelle classe d’entités en sortie comportant les champs suivants, qui récapitulent les groupes à chaque emplacement de la valeur du paramètre Input Space Time Cube (Cube spatio-temporel en entrée) :
|
Alias |
Nom du champ |
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Emplacements avec |
|
|
Emplacement avec un élément |
|
|
|
|
|
Autres résumés statistiques comprenant la somme, la valeur minimale, la valeur maximale, la moyenne, l’écart type et la valeur médiane de la variable analysée. |
|
Enfin, l’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales) ajoute un certain nombre de nouvelles variables à la valeur du paramètre Input Space Time Cube (Cube spatio-temporel en entrée). Si ces variables existent déjà (si vous exécutez plusieurs fois l’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales) pour la même valeur de paramètre Analysis Variable [Variable d’analyse]), elles sont remplacées afin que le cube contienne toujours les résultats d’analyse les plus récents.
Vous pouvez visualiser ces variables à l’aide d’ArcGIS Pro. Pour les stratégies, reportez-vous à la rubrique Visualiser le cube spatio-temporel.
Interprétation
Pour faciliter l’interprétation des résultats de l’outil Local Outlier Analysis (Analyse des valeurs aberrantes locales), vous pouvez utiliser l’outil Make Space Time Cube Layer (Créer une couche de cube spatio-temporel) pour créer une couche de cube spatio-temporel pouvant afficher les variables des résultats ajoutées au cube. Vous pouvez visualiser l’indice local de Morans, la valeur p et l’élément Cluster Outlier Analysis Type pour chaque groupe en sélectionnant la couche de cube spatio-temporel. De plus, sur le ruban du cube spatio-temporel, vous pouvez définir Display Theme (Thème d’affichage) sur le thème approprié dans la section Local Outlier Analysis (Analyse des valeurs aberrantes locales). Un indice ayant une valeur positive indique qu’un groupe est voisin de groupes présentant également des valeurs attributaires élevées ou faibles ; ce groupe fait partie d’un agrégat. Un indice ayant une valeur négative indique qu’un groupe est voisin de groupes présentant des valeurs différentes ; ce groupe est un point aberrant. Dans les deux cas, la pseudo valeur p ou la valeur p de l’entité doit être assez faible pour que l’agrégat ou le point aberrant soit considéré comme statistiquement significatif. Pour plus d’informations sur la définition de la signification statistique, reportez-vous à la rubrique Qu’est-ce qu’un score z ? Qu’est-ce qu’une valeur p ?. Notez que l’indice local de Moran est une mesure relative et qu’il ne peut être interprété que dans le contexte de sa distribution de référence générée et de sa pseudo valeur p ou valeur p calculée. La pseudo valeur p ou les valeur p signalées dans la classe d’entités en sortie sont corrigées pour tenir compte des tests multiples et de la dépendance spatiale.
Le type d’agrégat ou de point aberrant distingue les agrégats statistiquement significatifs de valeurs élevées (élevé-élevé), les agrégats de valeurs faibles (faible-faible), les points aberrants dans lesquels une valeur élevée est entourée principalement de valeurs faibles (élevé-faible) et les points aberrants dans lesquels une valeur faible est entourée principalement de valeurs élevées (faible-élevé). La signification statistique est définie au niveau de confiance de 95 pour cent. Cette signification représente une correction FDR, qui ajuste le seuil de valeur p de 0,05 sur une valeur reflétant mieux le niveau de confiance de 95 %, en prenant en compte des tests multiples.
Valeurs par défaut du voisinage
Pour déterminer si la valeur de groupe à un emplacement dans l’espace et dans le temps fait partie d’un point chaud, froid ou aberrant statistiquement significatif, chaque groupe est évalué en fonction des groupes spatio-temporels voisins. Par défaut, cet outil utilise la méthode Fixed distance (Distance fixe) pour définir les relations entre les groupes. Les valeurs des paramètres Neighborhood Distance (Distance de voisinage) et Neighborhood Time Step (Intervalle temporel de voisinage) définissent l’étendue du voisinage de chaque groupe (le contexte de l’analyse de chaque groupe). Supposons des dimensions de bins de 400 mètres sur 400 mètres sur un jour. Si vous définissez la valeur du paramètre Neighborhood Distance (Distance de voisinage) sur 801 mètres et la valeur du paramètre Neighborhood Time Step (Intervalle temporel de voisinage) sur 2, les voisins spatiaux s’étendent sur deux groupes horizontalement et verticalement et sur un groupe en diagonale, comme illustré :

En outre, il existera des voisins temporels. Tous les bins au même emplacement que la cible et ses voisins spatiaux (illustrés ci-dessus) pour les périodes correspondantes ou les deux périodes précédentes, à savoir un total de trois jours dans cet exemple, sont inclus en tant que voisins. Notez que les voisins temporels sont uniquement dans le passé et qu’une valeur de paramètre Neighborhood Time Step (Intervalle temporel de voisinage) de 2 englobe trois intervalles temporels. Pour garantir que chaque emplacement possède au moins un voisin temporel, l’indice local de Moran n’est pas calculé pour les groupes de la première tranche horaire. Les valeurs de groupe de la première tranche horaire sont cependant incluses dans le calcul de la moyenne globale.
Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Distance (Distance du voisinage), une valeur par défaut est calculée. La formule est produite à partir du calcul utilisé pour déterminer un rayon de recherche de densité du noyau par défaut. Si vous n’indiquez pas de valeur pour le paramètre Neighborhood Time Step (Intervalle temporel de voisinage), la valeur par défaut est égale à 1.
Des options supplémentaires permettent de définir des relations de voisinage à l’aide du paramètre Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales). Pour chacune des options, l’outil recherche d’abord des voisins spatiaux, puis les groupes se trouvant aux mêmes emplacements que les N intervalles temporels précédents, N représentant la valeur du paramètre Neighborhood Time Step (Intervalle temporel de voisinage) que vous spécifiez.
Le choix du paramètre Conceptualization of Spatial Relationships (Conceptualisation des relations spatiales) doit refléter les relations inhérentes entre les entités que vous analysez. Plus la modélisation des interactions entre les entités dans l’espace est réaliste, plus les résultats sont précis. Des recommandations sont présentées dans la section Pratiques recommandées pour sélectionner une conceptualisation de relations spatiales.
Permutations
Les permutations permettent de déterminer la probabilité de détecter la distribution spatiale réelle des valeurs que vous analysez en comparant vos valeurs à un ensemble de valeurs générées de manière aléatoire. Même avec une structure spatiale totalement aléatoire (complete spatial randomness, CSR), un certain niveau d’agrégation est toujours observé en raison du caractère aléatoire. Les permutations génèrent de nombreux jeux de données aléatoires et comparent ces valeurs à l’indice local de Moran de vos données d’origine. Pour cela, chaque permutation réorganise de manière aléatoire les valeurs voisines autour de chaque groupe et calcule la valeur d’indice local de Moran de ces données aléatoires. En regardant la distribution de l’indice local de Moran généré à partir des permutations, vous pouvez voir la plage de valeurs de l’indice local de Moran pouvant raisonnablement découler du caractère aléatoire. Si vos données présentent un modèle spatial statistiquement significatif, les valeurs de l’indice local de Moran générées à partir des permutations doivent présenter une agrégation moindre que la valeur de l’indice local de Moran de vos données d’origine. Une pseudo valeur p est ensuite calculée en déterminant la proportion de valeurs de l’indice local de Moran générées à partir des permutations qui présentent une agrégation plus élevée que vos données d’origine. Si cette proportion (la pseudo valeur p) est faible (inférieure à 0,05), vous pouvez en conclure que vos données contiennent vraiment une agrégation statistiquement significative.
Le choix du nombre de permutations doit faire l’objet d’un compromis entre précision et augmentation du temps de traitement. L’augmentation du nombre de permutations améliore la précision en augmentant la plage des valeurs possibles pour la pseudo valeur p. Ainsi, avec 99 permutations, la précision de la pseudo valeur p est de 0,01 (1/99+1), et pour 999 permutations, la précision est de 0,001 (1/999+1). Il est possible d’utiliser un nombre moins élevé de permutations lors de la première exploration d’un problème, mais il est recommandé d’augmenter les permutations au nombre le plus élevé possible pour les résultats finaux.
Ressources supplémentaires
Anselin, Luc. "Local Indicators of Spatial Association—LISA," Geographical Analysis 27(2): 93–115, 1995.
Mitchell, Andy. The ESRI Guide to GIS Analysis, Volume 2. ESRI Press, 2005.





