Skip to main content

Fonctionnement de l’outil Résumés statistiques de voisinage

L’outil Résumés statistiques de voisinage calcule les résumés statistiques locaux d’un ou de plusieurs champs numériques d’entités ponctuelles ou surfaciques à l’aide des voisinages. Les statistiques locales incluent la moyenne, la médiane, l’écart type, l’écart interquartile, l’asymétrie et l’asymétrie par quantiles. Les voisinages incluent le canal de distance, le nombre de voisins, la contiguïté surfacique et les fichiers de pondérations spatiales. Vous pouvez pondérer géographiquement toutes les statistiques locales à l’aide de noyaux.

Illustration de l’outil Résumés statistiques de voisinage

Les résumés statistiques sont calculés à l’aide des voisinages autour de chaque entité focale.

Types de voisinage

Le paramètre Neighborhood Type (Type de voisinage) possède six options qui permettent de définir les entités utilisées comme voisins de chaque entité focale. Pour tous les types de voisinage, l’entité focale est utilisée comme voisin d’elle-même par défaut. Vous pouvez choisir d’exclure l’entité focale en tant que voisin en désélectionnant le paramètre Include Focal Feature in Calculations (Inclure l’entité focale dans le calcul).

  • Distance band (Canal de distance) : toutes les entités qui se trouvent à une distance donnée (dans la limite de 1 000 entités) sont utilisées comme voisins. La distance par défaut est la distance la plus courte qui permet de s’assurer que chaque entité inclut au moins un voisin supplémentaire.

    Voisinage de la bande de distance

  • Number of neighbors (Nombre de voisins) : un nombre fixe d’entités les plus proches de l’entité focale sont utilisées comme voisins. Ce nombre n’incluant pas l’entité focale elle-même, si cette dernière est incluse dans les calculs, le nombre de voisins utilisés dans les calculs correspond à la valeur spécifiée plus un.

    Voisinage du nombre de voisins

  • Contiguity edges only (Tronçons de contiguïté uniquement) : les polygones qui partagent un tronçon avec l’entité focale sont utilisés comme voisins. Cette option ne s’applique qu’aux entités surfaciques.

    Voisinage de la contigüité surfacique avec uniquement des segments

  • Contiguity edges corners (Angles des tronçons de contiguïté) : les polygones qui partagent un tronçon ou un angle avec l’entité focale sont utilisés comme voisins. Cette option ne s’applique qu’aux entités surfaciques.

    Voisinage de la contigüité surfacique avec segments et angles

  • Delaunay triangulation (Triangulation de Delaunay) : les voisins sont définis en partageant des tronçons et des angles dans leur triangulation de Delaunay. Utiliser cette option revient à utiliser l’outil Créer des polygones de Thiessen sur les points et à utiliser l’option Contiguity edges corners (Angles des segments de contiguïté) sur les polygones de Thiessen. Cette option ne s’applique qu’aux entités ponctuelles.

    Voisinage de la triangulation de Delaunay

  • Get spatial weights from file (Extraire les pondérations spatiales à partir du fichier) : les voisins et pondérations de chaque entité sont définis par un fichier de matrice de pondérations spatiales spécifié dans le paramètre Weights Matrix File (Fichier de matrice de pondérations). Vous pouvez créer les fichiers à l’aide des outils Générer la matrice de pondérations spatiales et Générer les pondérations spatiales de réseau.

Résumés statistiques

Six résumés statistiques peuvent être calculés pour chaque champ d’analyse, spécifiés à l’aide du paramètre Local Summary Statistic (Résumé statistique local). Ces six statistiques comprennent des mesures de centralité, des mesures de variabilité et de propagation, ainsi que des mesures de symétrie. Chaque classe fournit deux statistiques, une traditionnelle et une robuste. Les statistiques robustes sont des mesures statistiques qui ne sont pas affectées par un petit nombre de points aberrants.

L’option All (Toutes) du paramètre Local Summary Statistic (Résumé statistique local) est utilisée par défaut pour calculer les six statistiques de chaque champ d’analyse. Les formules de chaque statistique peuvent être consultées dans la section Formules des statistiques locales.

Les mesures de centralité sont utilisées pour estimer le milieu ou le centre d’une distribution de valeurs. Vous pouvez utiliser ces options pour lisser les valeurs dans des données bruyantes. Les mesures de centralité sont les suivantes :

  • Moyenne (traditionnelle) : moyenne arithmétique des valeurs du champ d’analyse.

  • Médiane (fiable) : 50e percentile des valeurs du champ d’analyse. La moitié des valeurs se trouvent en dessous de la médiane et l’autre moitié, au-dessus.

Les mesures de variabilité ou de propagation sont utilisées pour estimer la plage de distribution des valeurs probables. Vous pouvez utiliser ces options pour vérifier si la variabilité des champs d’analyse est similaire dans toute la carte (appelée stationarité de variance) ou si certaines zones présentent une forte variabilité locale plus élevée que d’autres. Les mesures de variabilité sont les suivantes :

  • Écart type (traditionnel) : écart type des valeurs du champ d’analyse.

  • Écart interquartile (fiable) : plage de la moitié médiane des valeurs du champ d’analyse (75e percentile moins 25e percentile). La moitié des données se situe dans cette plage.

Les mesures de symétrie sont utilisées pour déterminer si la forme d’une distribution est symétrique autour du milieu. Ces options peuvent être utilisées pour étudier la fréquence des valeurs extrêmes élevées et faibles. Les mesures de symétrie sont les suivantes :

  • Asymétrie (traditionnelle) : asymétrie des valeurs du champ d’analyse.

  • Asymétrie par quantiles (fiable) : valeur comprise entre -1 et 1 indiquant la position de la médiane par rapport aux 25e et 75e percentiles. Des valeurs proches de -1 indiquent que la médiane est proche du 25e percentile, et des valeurs proches de 1 indiquent qu’elle est proche du 75e percentile. Des valeurs proches de 0 indiquent une symétrie où la médiane se situe à mi-chemin entre le 25e et le 75e percentile.

Valeurs nulles dans les champs d’analyse

Si l’un des champs d’analyse contient des valeurs nulles, ces dernières sont ignorées par défaut dans les calculs. Vous pouvez choisir d’inclure les valeurs nulles en décochant le paramètre Ignore Null Values in Calculations (Ignorer les valeurs nulles dans les calculs).

Si les valeurs nulles sont ignorées dans un calcul, le nombre de voisins est réduit pour tous les calculs. Par exemple, si deux des six voisins possèdent des valeurs nulles, la moyenne est calculée en totalisant uniquement les quatre valeurs non nulles et en divisant le résultat par quatre.

Si des valeurs nulles sont incluses, toutes les statistiques sont calculées comme nulles si l’une des valeurs utilisées dans le calcul est nulle. Par exemple, si une entité contient une valeur nulle dans un champ d’analyse, toutes les autres entités qui utilisent cette entité comme voisin généreront des valeurs nulles pour tous les résumés statistiques du champ d’analyse.

Sorties de l’outil

Les entités en sortie sont symbolisées sur la carte à l’aide de la statistique spécifiée dans le paramètre Local Summary Statistic (Résumé statistique local) calculé pour le premier champ d’analyse fourni (ou la distance jusqu’aux voisins si aucun champ d’analyse n’est fourni). Si vous sélectionnez All (Toutes) pour le résumé statistique local, les entités affichent les résultats de la statistique Moyenne. Les résumés statistiques pour tous les autres champs d’analyse sont enregistrés en tant que champs dans les entités en sortie, avec des copies de tous les champs d’analyse. Il existe également des champs indiquant le nombre de voisins utilisés pour chaque champ d’analyse.

Résumés statistiques pondérés géographiquement

Si le paramètre Neighborhood Type (Type de voisinage) spécifié est Distance Band (Canal de distance) ou Number of Neighbors (Nombre de voisins), les statistiques peuvent toutes être pondérées géographiquement à l’aide du paramètre Local Weighting Scheme (Structure de pondération locale). Si vous spécifiez Get spatial Weights from file (Extraire les pondérations spatiales à partir du fichier) pour le paramètre Neighborhood Type (Type de voisinage), les pondérations spécifiées dans le fichier sont utilisées comme structure de pondération. Si vous appliquez une structure de pondération, tous les résumés statistiques sont pondérés de sorte que les voisins plus proches de l’entité focale reçoivent des pondérations plus élevées dans les calculs à l’aide d’une fonction (noyau) qui diminue avec la distance par rapport à l’entité focale. Deux fonctions noyau sont fournies dans le paramètre Local Weighting Scheme (Structure de pondération locale).

  • Bisquare (Bicarré)
\[ \text{weight} = \Bigl(1 - (\frac{\text{Distance}}{\text{Bandwidth}})^2\Bigr)^2 \]
  • Gaussian (Gaussien)
\[ \text{weight} = \exp!\bigl(-0.5 ,(\frac{\text{Distance}}{\text{Bandwidth}})^2\bigr). \]

Les fonctions de noyau dépendent d’une bande passante qui contrôle la rapidité à laquelle les pondérations diminuent avec la distance. La largeur de bande passante de chaque noyau est fournie dans le paramètre Kernel Bandwidth (Bande passante de noyau). Si aucune valeur n’est spécifiée, une valeur par défaut est estimée au moment de l’exécution et s’affiche dans un message de géotraitement. Pour plus d’informations sur le mode de calcul de cette bande passante par défaut, reportez-vous à la rubrique Fonctionnement de l’outil Densité de noyau.

Remarque :

Pour le voisinage du canal de distance, la bande passante du noyau utilise par défaut la même valeur que le paramètre Distance Band (Canal de distance).

Formules pour les statistiques locales

Cette section contient les formules pour les versions pondérées et non pondérées de tous les résumés statistiques d’une entité focale. Ces formules sont appliquées à chaque entité en entrée pour tous les champs d’analyse.

Dans toutes les formules, i = 1, ..., n sont les voisins de l’entité focale (comprenant éventuellement l’entité focale elle-même) triés par valeur (xi) dans un ordre croissant. Toutes les pondérations (wi) sont normalisées pour que leur somme soit égale à un avant que ces formules soient appliquées. La formule non pondérée de chaque statistique est déduite en définissant wi = 1/n pour tous les voisins i.

Statistiques traditionnelles

Le tableau suivant présente la version pondérée et non pondérée de chaque résumé statistique traditionnel.

Statistique

Formule pondérée

Formule non pondérée

Moyenne

\[ \bar{x}_w = \sum_{i=1}^n w_i,x_i \]
\[ \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i \]

Écart type

\[ s_w = \sqrt{\sum_{i=1}^n w_i,(x_i - \bar{x}_w)^2} \]
\[ s = \sqrt{\frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2} \]

Inclinaison

\[ b_w = \frac{\sqrt[3]{\sum_{i=1}^n w_i,(x_i - \bar{x}_w)^3}}{s_w} \]
\[ b = \frac{\sqrt[3]{\frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^3}}{s} \]

Statistiques robustes

Toutes les statistiques robustes dépendent de la définition d’un p-quantile pondéré, où p est compris entre 0 et 1. Cette définition sert à calculer la médiane pondérée (p=0,5), le premier quartile (p=0,25) et le troisième quartile (p=0,75). Le p-quantile pour un p donné est défini comme suit :

  • P-quantile pondéré :
\[ Q_{p,w} = \begin{cases} \frac{1}{2}\bigl(x_i + x_{i+1}\bigr), & \sum_{j=1}^i w_j = p, \[6pt] x_{i+1}, & \sum_{j=1}^i w_j < p < \sum_{j=1}^{i+1} w_j \end{cases} \]
  • P-quantile non pondéré :
\[ Q_{p} = \begin{cases} \frac{1}{2}\bigl(x_i + x_{i+1}\bigr), & \frac{i}{n} = p, \[6pt] x_{i+1}, & \frac{i}{n} < p < \frac{i+1}{n} \end{cases} \]

En utilisant la définition ci-dessus du p-quantile, le tableau suivant montre la version pondérée et non pondérée de chaque résumé statistique robuste.

Statistique

Formule pondérée

Formule non pondérée

Médiane

\[ Med_w = Q_{0.5,w} \]
\[ Med = Q_{0.5} \]

Ecart interquartile

\[ IQR_w = Q_{0.75,w} - Q_{0.25,w} \]
\[ IQR = Q_{0.75} - Q_{0.25} \]

Déséquilibre quantile

\[ QI_w = \frac{2,Med_w - (Q_{0.25,w} + Q_{0.75,w})}{IQR_w} \]
\[ QI = \frac{2,Med - (Q_{0.25} + Q_{0.75})}{IQR} \]

Ressources supplémentaires

Pour des informations supplémentaires sur les résumés statistiques pondérés géographiquement, consultez la référence suivante :

  • Brunsdon, C., A.S. Fotheringham, M. Charlton. 2002. "Geographically weighted summary statistics — a framework for localised exploratory data analysis." Computers, Environment and Urban Systems 26 (6): 501-524. ISSN 0198-9715. https://doi.org/10.1016/S0198-9715(01)00009-6.