Skip to main content

Cómo funciona Estadísticas de resumen de vecindad

La herramienta Estadísticas de resumen de vecindad calcula estadísticas de resumen locales de uno o más campos numéricos de entidades de puntos o poligonales utilizando vecindades. Las estadísticas locales incluyen el valor medio (promedio), la mediana, la desviación estándar, el rango intercuartílico, el sesgo y el desequilibrio de cuantiles. Las vecindades incluyen archivos de bandas de distancia, cantidad de vecinos, contigüidad de polígonos y ponderaciones espaciales. Puede ponderar geográficamente todas las estadísticas locales utilizando kernels.

Ilustración de la herramienta Estadísticas de resumen de vecindad

Las estadísticas de resumen se calculan utilizando vecindades alrededor de cada entidad focal.

Tipos de vecindades

El parámetro Tipo de vecindad cuenta con seis opciones que se pueden utilizar para definir las entidades que se utilizan como vecinos de cada entidad focal. La entidad focal se utiliza como vecino de sí mismo en todos los tipos de vecindad de forma predeterminada. Puede elegir excluir la entidad focal como vecino desactivando el parámetro Incluir entidad focal en cálculos.

  • Banda de distancia: se utilizan como vecinos todas las entidades existentes dentro de una distancia especificada (hasta un máximo de 1.000 entidades). Esta distancia predeterminada es la distancia euclidiana que garantiza que cada entidad tenga como mínimo un vecino adicional.

    Vecindad de banda de distancia

  • Cantidad de vecinos: se utiliza como vecinos un número fijo de entidades más cercanas a la entidad focal. Este número no incluye la entidad focal en sí misma, por lo que, si la entidad focal se incluye en los cálculos, la cantidad de vecinos utilizada en los cálculos será mayor que el valor especificado.

    Vecindad de cantidad de vecinos

  • Solo bordes de contigüidad: se utilizan como vecinos cualquier polígono que comparta un borde con la entidad focal. Esta opción solo es aplicable a las entidades poligonales.

    Contigüidad de polígono solo con vecindad de bordes

  • Bordes o esquinas de contigüidad: se utilizan como vecinos cualquier polígono que comparta un borde o esquina con la entidad focal. Esta opción solo es aplicable a las entidades poligonales.

    Contigüidad de polígono con vecindad de bordes y esquinas

  • Triangulación de Delaunay: los vecinos se definen compartiendo bordes o esquinas en su triangulación de Delaunay. Utilizar esta opción equivale a utilizar la herramienta Crear polígonos de Thiessen con los puntos y utilizar la opción Bordes o esquinas de contigüidad con los polígonos de Thiessen. Esta opción solo está disponible para las entidades de puntos.

    Vecindad de triangulación de Delaunay

  • Obtener ponderaciones espaciales a partir del archivo: los vecinos y las ponderaciones de cada entidad se definen mediante un archivo de matriz de ponderaciones espaciales especificado en el parámetro Archivo de matriz de ponderaciones. Es posible crear los archivos con las herramientas Generar matriz de ponderaciones espaciales y Generar ponderaciones espaciales de red.

Estadísticas de resumen

Hay seis estadísticas de resumen que se pueden calcular para cada campo de análisis, especificadas mediante el parámetro Estadística de resumen local. Las seis estadísticas incluyen mediciones de centralidad, mediciones de variabilidad y dispersión y mediciones de simetría. Cada clase ofrece dos estadísticas: una tradicional y otra robusta. Las estadísticas robustas son mediciones estadísticas que no se ven afectadas por un pequeño número de valores atípicos.

La opción Todas del parámetro Estadística de resumen local se utiliza de forma predeterminada para calcular las seis estadísticas correspondientes a cada campo de análisis. Las fórmulas de cada estadística se pueden consultar en la sección Fórmulas de las estadísticas locales.

Las medidas de centralidad se utilizan para estimar el punto medio o el centro de una distribución de valores. Puede utilizar estas opciones para suavizar los valores en datos con ruido. Las mediciones de centralidad son las siguientes:

  • Media (tradicional): la media aritmética (promedio) de los valores del campo de análisis.

  • Mediana (robusta): el percentil 50 de los valores del campo de análisis. La mitad de los valores se sitúan por debajo de la mediana y la otra mitad, por encima.

Las mediciones de variabilidad o dispersión se utilizan para estimar el rango de la distribución de los valores probables. Puede utilizar estas opciones para investigar si la variabilidad en los campos de análisis es similar en todo el mapa (lo que se denomina estacionariedad de la varianza) o si determinadas áreas presentan una variabilidad local mayor que otras. Las mediciones de variabilidad son las siguientes:

  • Desviación estándar (tradicional): la desviación estándar de los valores del campo de análisis.

  • Rango intercuartílico (robusto): el rango que abarca la mitad central de los valores del campo de análisis (el percentil 75 menos el percentil 25). La mitad de los datos se encuentran dentro de este rango.

Las mediciones de simetría se utilizan para medir si la forma de una distribución es simétrica respecto al centro. Estas opciones se pueden utilizar para investigar la frecuencia de los valores extremos altos y bajos. Las mediciones de simetría son las siguientes:

  • Sesgo (tradicional): el sesgo de los valores del campo de análisis.

  • Desequilibrio de cuantiles (robusto): valor dentro de un rango de -1 a 1 que indica la posición de la mediana con respecto a los percentiles 25 y 75. Los valores cercanos a -1 indican que la mediana se encuentra cerca del percentil 25, y los valores cercanos a 1 indican que la mediana se encuentra cerca del percentil 75. Los valores cercanos a 0 indican simetría, en donde la mediana se sitúa a mitad de camino entre los percentiles 25 y 75.

Valores nulos en los campos de análisis

Si alguno de los campos de análisis tiene valores nulos, estos valores nulos se ignorarán en los cálculos de forma predeterminada. Puede elegir incluir los valores nulos desactivando el parámetro Ignorar valores nulos en cálculos.

Cuando se ignoran los valores nulos en un cálculo, la cantidad de vecinos se ajusta por defecto en todos los cálculos. Por ejemplo, si dos de los seis vecinos tienen valores nulos, la media se halla sumando solamente los cuatro valores no nulos y dividiendo entre cuatro.

Si se incluyen los valores nulos, todas las estadísticas se calcularán como nulas si cualquiera de los valores utilizados en el cálculo es nulo. Por ejemplo, si una entidad tiene un valor nulo en un campo de análisis, el resto de entidades que consideren la entidad como un vecino calcularán un valor nulo para todas las estadísticas de resumen del campo de análisis.

Salidas de la herramienta

Las entidades de salida se representan en el mapa utilizando la estadística especificada en el parámetro Estadística de resumen local, calculada para el primer campo de análisis proporcionado (o la distancia a los vecinos si no se ha proporcionado ningún campo de análisis). Si elige Todas en la estadística de resumen local, las entidades muestran los resultados de la estadística Media. Las estadísticas de resumen de todos los demás campos de análisis se guardan como campos en las entidades de salida, junto con copias de todos los campos de análisis. También hay campos que indican la cantidad de vecinos utilizados para cada campo de análisis.

Estadísticas de resumen ponderadas geográficamente

Cuando el parámetro Tipo de vecindad se establece en Banda de distancia o Cantidad de vecinos, todas las estadísticas se pueden ponderar geográficamente mediante el parámetro Esquema de ponderación local. Si especifica Obtener ponderaciones espaciales a partir del archivo para el parámetro Tipo de vecindad, se utilizan como esquema de ponderación las ponderaciones especificadas en el archivo. Si se aplica un esquema de ponderación, todas las estadísticas de resumen se ponderan de tal manera que los vecinos más cercanos a la entidad focal reciben ponderaciones más altas en los cálculos, mediante una función, denominada kernel, que disminuye con la distancia respecto a la entidad focal. En el parámetro Esquema de ponderación local, se incluyen dos funciones kernel.

  • Bicuadrado
\[ \text{weight} = \Bigl(1 - (\frac{\text{Distance}}{\text{Bandwidth}})^2\Bigr)^2 \]
  • Gaussiano
\[ \text{weight} = \exp!\bigl(-0.5 ,(\frac{\text{Distance}}{\text{Bandwidth}})^2\bigr). \]

La función kernel depende de un ancho de banda que controla la velocidad con la que las ponderaciones disminuyen con la distancia. El ancho de banda de cada kernel se proporciona en el parámetro Ancho de banda kernel. Si no se proporciona ningún valor, se calcula uno predeterminado en tiempo de ejecución y se muestra como mensaje de geoprocesamiento. Consulte Cómo funciona la densidad kernel para obtener información sobre cómo se calcula este ancho de banda predeterminado.

Nota:

Para la vecindad de banda de distancia, el ancho de banda kernel se establece de forma predeterminada en el mismo valor que el parámetro Banda de distancia.

Fórmulas para las estadísticas locales

Esta sección contiene las fórmulas para las versiones ponderadas y no ponderadas de todas las estadísticas de resumen de una única entidad focal. Estas fórmulas se aplican a cada entidad de entrada para todos los campos de análisis.

En todas las fórmulas, i = 1, ..., n son los vecinos de la entidad focal (incluida, posiblemente, la propia entidad focal), ordenados por valor (xi) en orden ascendente. Todas las ponderaciones (wi) se normalizan para que su suma sea igual a uno antes de aplicar estas fórmulas. La fórmula sin ponderar de cada estadística se deriva estableciendo wi = 1/n para todos los vecinos i.

Estadísticas tradicionales

La siguiente tabla muestra la versión ponderada y la no ponderada de cada estadística de resumen tradicional.

Estadística

Fórmula ponderada

Fórmula no ponderada

Valor medio

\[ \bar{x}_w = \sum_{i=1}^n w_i,x_i \]
\[ \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i \]

Desviación estándar

\[ s_w = \sqrt{\sum_{i=1}^n w_i,(x_i - \bar{x}_w)^2} \]
\[ s = \sqrt{\frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2} \]

Sesgo

\[ b_w = \frac{\sqrt[3]{\sum_{i=1}^n w_i,(x_i - \bar{x}_w)^3}}{s_w} \]
\[ b = \frac{\sqrt[3]{\frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^3}}{s} \]

Estadísticas robustas

Todas las estadísticas robustas dependen de la definición de un cuantíl p ponderado, donde p está comprendido entre 0 y 1. Esta definición se utiliza para calcular la mediana ponderada (p=0,5), el primer cuartil (p=0,25) y el tercer cuartil (p=0,75). El cuantíl p para un valor dado de p se define de la siguiente manera:

  • Cuantil p ponderado:
\[ Q_{p,w} = \begin{cases} \frac{1}{2}\bigl(x_i + x_{i+1}\bigr), & \sum_{j=1}^i w_j = p, \[6pt] x_{i+1}, & \sum_{j=1}^i w_j < p < \sum_{j=1}^{i+1} w_j \end{cases} \]
  • Cuantil p no ponderado:
\[ Q_{p} = \begin{cases} \frac{1}{2}\bigl(x_i + x_{i+1}\bigr), & \frac{i}{n} = p, \[6pt] x_{i+1}, & \frac{i}{n} < p < \frac{i+1}{n} \end{cases} \]

Utilizando la definición anterior del cuantil p, la siguiente tabla muestra la versión ponderada y no ponderada de cada estadística de resumen robusta.

Estadística

Fórmula ponderada

Fórmula no ponderada

Mediana

\[ Med_w = Q_{0.5,w} \]
\[ Med = Q_{0.5} \]

Rango intercuartílico

\[ IQR_w = Q_{0.75,w} - Q_{0.25,w} \]
\[ IQR = Q_{0.75} - Q_{0.25} \]

Desequilibrio de cuantiles

\[ QI_w = \frac{2,Med_w - (Q_{0.25,w} + Q_{0.75,w})}{IQR_w} \]
\[ QI = \frac{2,Med - (Q_{0.25} + Q_{0.75})}{IQR} \]

Recursos adicionales

Para obtener más información sobre las estadísticas de resumen ponderadas geográficamente, consulte la siguiente referencia:

  • Brunsdon, C., A.S. Fotheringham, M. Charlton. 2002. "Geographically weighted summary statistics — a framework for localised exploratory data analysis." Computers, Environment and Urban Systems 26 (6): 501-524. ISSN 0198-9715. https://doi.org/10.1016/S0198-9715(01)00009-6.