Análisis de cluster y de valor atípico (I Anselin local de Moran) (Herramientas de estadística espacial)
Resumen
Identifica puntos calientes, puntos fríos y valores atípicos espaciales estadísticamente significativos mediante la estadística de I Anselin local de Moran, dado un conjunto de entidades ponderadas.
Ilustración

Uso
Esta herramienta crea una nueva Clase de entidad de salida con los siguientes atributos para cada entidad de la Clase de entidad de entrada: índice I de Moran local, puntuación z, pseudo valor P y tipo de clúster/valor atípico (
COType).Las puntuaciones z y los valores p son medidas de significancia estadística que indican si se rechazará la hipótesis nula, entidad por entidad. En efecto, indican si la aparente similitud (un clustering espacial de valores altos o bajos) o la falta de similitud (un valor atípico espacial) es más marcada de lo que se espera en una distribución aleatoria. Los valores p y las puntuaciones z de la Clase de entidades de salida no reflejan ninguna corrección del FDR (Índice de descubrimientos falsos).
Una puntuación z positiva alta para una entidad indica que las entidades circundantes tienen valores similares (ya sea valores altos o bajos). El campo
COTypeen la Clase de entidad de salida será Alto/alto para un clúster de valores altos estadísticamente significativo y Bajo/bajo para un clúster de valores bajos estadísticamente significativo.Una puntuación z negativa baja (por ejemplo, inferior a -3,96) para una entidad indica un valor atípico de datos espacial estadísticamente significativo. El campo
COTypeen la Clase de entidad de salida indicará si la entidad tiene un valor alto y está rodeada por entidades con valores bajos (Alto/bajo) o si la entidad tiene un valor bajo y está rodeada por entidades con valores altos (Bajo/alto).El campo
COTypeindicará siempre unos clústeres y valores atípicos estadísticamente significativos para un nivel de confianza del 95 por ciento. Solamente las entidades estadísticamente significativas tienen valores para el campoCOType. Cuando se marca el parámetro opcional Aplicar corrección False Discovery Rate (FDR), la importancia estadística se basa en un nivel de confianza corregido del 95 por ciento.La representación en pantalla predeterminada para la Clase de entidad de salida se basa en los valores del campo
COType.La salida de esta herramienta también incluye un histograma donde el valor del Campo de entrada se representa en un gráfico y un gráfico de dispersión de Moran. Puede acceder a estos gráficos desde el panel Contenido en Clase de entidad de salida.
Las permutaciones se utilizan para determinar la probabilidad de encontrar la distribución espacial real de los valores que está analizando. Para cada permutación, los valores de vecindad alrededor de cada entidad se reorganizan aleatoriamente y se calcula el valor I de Moran local. El resultado es una distribución de referencia de los valores que luego se comparan con el valor I de Moran real observado para determinar la probabilidad de que el valor observado pueda encontrarse en la distribución aleatoria. El valor predeterminado es de 499 permutaciones; no obstante, la distribución de la muestra aleatoria se ha mejorado con más permutaciones, lo que mejora la precisión del pseudo valor P.
Si el parámetro Número de permutaciones está establecido en 0, el resultado es un valor P tradicional en lugar de un pseudo valor P, y la puntuación z se basa en el cálculo de la hipótesis nula de aleatorización. Para obtener más información sobre las puntuaciones z y los valores P, consulte ¿Qué es una puntuación z? ¿Qué es un valor p?
Cuando la Clase de entidad de entrada no está proyectada (es decir, cuando las coordenadas se especifican en grados, minutos y segundos) o cuando el sistema de coordenadas de salida está establecido en un Sistema de coordenadas geográficas, las distancias se calculan mediante mediciones de cuerda. Las mediciones de distancia de cuerda se utilizan porque se pueden calcular rápidamente y proporcionan estimaciones muy buenas de las verdaderas distancias geodésicas, al menos para los puntos separados un máximo de unos treinta 30 grados entre sí. Las distancias de cuerda se basan en un esferoide oblato. Dados dos puntos en la superficie de la Tierra, la distancia de cuerda entre ellos es la longitud de una línea, que atraviesa la Tierra tridimensional, para conectar estos dos puntos. Las distancias de cuerda se informan en metros.
Precaución:
Asegúrese de proyectar los datos si su área de estudio se extiende más allá de los 30 grados. Las distancias de cuerda no son una buena estimación de las distancias geodésicas más allá de 30 grados.
Cuando se utilizan distancias de cuerda en el análisis, el parámetro Banda de distancia o distancia de umbral, si se especifica, debe proporcionarse en metros.
Los centroides de entidad se utilizan en los cálculos de distancia para las entidades de línea y polígono. Para multipuntos, polilíneas o polígonos con varias partes, el centroide se calcula utilizando el centro medio ponderado de todas las partes de entidad. La ponderación para las entidades de punto es 1, para las entidades de línea es longitud y para las entidades de polígono es área.
El Campo de entrada debe contener una variedad de valores. La operación matemática para esta estadística requiere cierta variación en la variable analizada; no puede resolver si todos los valores de entrada son 1, por ejemplo. Si desea utilizar esta herramienta para analizar el patrón espacial de los datos de incidentes, considere agregar los datos de incidentes. La herramienta Análisis de puntos calientes optimizado también se puede utilizar para analizar el patrón espacial de datos de incidentes.
Nota:
Los datos de incidentes son puntos que representan eventos (delincuencia, accidentes de tráfico) u objetos (árboles, tiendas) donde el foco se centra en su presencia o ausencia en lugar de atributos de medición asociados a cada punto.
Su elección del parámetro Conceptualización de relaciones espaciales deberá reflejar relaciones inherentes entre las entidades que analiza. Cuanto más pueda modelar de manera realista cómo interactúan mutuamente las entidades en el espacio, más precisos serán sus resultados. Las recomendaciones se describen en Seleccionar una conceptualización de relaciones espaciales: prácticas recomendadas. Aquí le presentamos algunas sugerencias adicionales:
Banda de distancia fija
Utiliza una Banda de distancia o Distancia de umbral y garantizará que cada entidad tenga al menos un vecino. Es importante, pero en muchos casos este valor predeterminado no es la distancia más apropiada para el análisis. En Seleccionar un valor de banda de distancia fija se describen estrategias adicionales para [seleccionar una escala apropiada] (banda de distancia) para su análisis(modeling-spatial-relationships.md#3D9).
Distancia inversa o Distancia inversa cuadrada
Cuando se introduce cero para el parámetro Banda de distancia o distancia de umbral, se considera que todas las entidades son vecinas de las demás entidades; cuando este parámetro se deja en blanco, se aplica la distancia predeterminada.
Los pesos de las distancias menores que 1 se vuelven inestables cuando se invierten. Por consiguiente, a los pesos de entidades separadas por menos de 1 unidad de distancia se les da un peso de 1.
Para las opciones de distancia inversa (Distancia inversa, Distancia inversa cuadrada o Zona de indiferencia), se asignará un peso de uno a todos los pares de puntos coincidentes para evitar la división por cero. Esto garantiza que las entidades no sean excluidas del análisis.
Las opciones adicionales para el parámetro Conceptualización de relaciones espaciales, incluidas las relaciones espaciotemporales, están disponibles mediante la herramienta Generar matriz de ponderaciones espaciales. Para aprovechar estas opciones adicionales, cree un archivo de matriz de ponderaciones espaciales antes del análisis; seleccione Obtener ponderaciones espaciales a partir del archivo para el parámetro Conceptualización de relaciones espaciales y, para el parámetro Archivo de matriz de ponderaciones, especifique la ruta del archivo de ponderaciones espaciales que creó.
En la documentación Análisis espacio-temporal se proporciona más información sobre el análisis clúster de espacio-tiempo.
Las capas de mapa pueden usarse para definir la Clase de entidad de entrada. Al utilizar una capa con una selección, solo las entidades seleccionadas se incluyen en el análisis.
Si se proporciona un Archivo de matriz de ponderaciones con una extensión
.swm, esta herramienta espera un archivo de matriz de ponderación espacial creado con la herramienta Generar matriz de ponderaciones espaciales; de lo contrario, esta herramienta espera un archivo de matriz de ponderaciones espaciales en formato ASCII. En algunos casos, el comportamiento es diferente según el tipo de archivo de matriz de ponderaciones espaciales que se utiliza:Archivos de matriz de ponderaciones espaciales con formato ASCII:
Las ponderaciones se utilizan como están. Las relaciones de entidad a entidad que faltan se tratan como ceros.
Si los pesos están estandarizados por fila, es probable que los resultados sean incorrectos para el análisis en los conjuntos de selección. Si necesita ejecutar un análisis en un conjunto de selección, convierta el archivo de ponderaciones espaciales ASCII a un archivo SWM leyendo los datos ASCII en una tabla y, a continuación, utilizando la opción Convertir tabla con la herramienta Generar matriz de ponderaciones espaciales.
Archivo de matriz de ponderaciones espaciales con formato SWM:
- Si los pesos están estandarizados en filas, se volverán a estandarizar para los conjuntos de selección; de lo contrario, los pesos se utilizan como están.
La ejecución de su análisis con un archivo de matriz de ponderaciones espaciales con formato ASCII consume mucha memoria. Para los análisis de más de 5.000 entidades, considere convertir su archivo de matriz de ponderaciones espaciales con formato ASCII en un archivo con formato SWM. Primero, coloque sus ponderaciones ASCII en una tabla con formato (por ejemplo, por medio de Excel). A continuación, ejecute la herramienta Generar matriz de ponderaciones espaciales utilizando Convertir tabla para el parámetro Conceptualización de relaciones espaciales. El resultado será un archivo de matriz de ponderaciones espaciales con formato .SWM.
La Clase de entidad de salida se agrega automáticamente a la tabla de contenido con la representación en pantalla predeterminada aplicada al campo
COType. La representación aplicada está definida por un archivo de capas en<ArcGIS Pro>\\Resources\\ArcToolBox\\Templates\\Layers. Puede volver a aplicar la representación predeterminada, si es necesario, utilizando la herramienta Aplicar simbología de capa.La Clase de entidad de salida incluye un campo
SOURCE_IDque permite Unir a la Clase de entidad de entrada, si es necesario.El tema de ayuda Modelado de relaciones espaciales ofrece información adicional sobre los parámetros de esta herramienta.
Precaución:
Al utilizar shapefiles tenga en cuenta que no pueden almacenar valores nulos. Las herramientas u otros procedimientos que crean shapefiles a partir de entradas sin shapefiles pueden almacenar o interpretar valores nulos como cero. En algunos casos, los nulos se almacenan como valores negativos muy grandes en shapefiles. Esto puede ocasionar resultados inesperados. Consulte Cuestiones de geoprocesamiento para el shapefile de salida para obtener más información.
Cuando esta herramienta se utiliza en scripts de Python, el objeto resultado devuelto tras ejecutar la herramienta tiene las siguientes salidas:
Posición
Descripción
Tipo de datos
0
Clase de entidad de salida
Clase de entidad
1
Nombre de campo de índice
Campo
2
Nombre de campo ZScore
Campo
3
Nombre de campo de probabilidad
Campo
4
Nombre de campo COType
Campo
5
Nombre de campo de Id. de la fuente
Campo
Parámetros
| Etiqueta | Explicación | Tipo de datos |
|---|---|---|
|
Clase de entidad de entrada |
La clase de entidad para la que se realizará el análisis de clúster y de valor atípico. |
Feature Layer |
|
Campo de entrada |
El campo numérico que se evaluará. |
Field |
|
Clase de entidad de salida |
La clase de entidad de salida que recibirá los campos de resultados. |
Feature Class |
|
Conceptualización de relaciones espaciales |
Especifica cómo se definen las relaciones espaciales entre las entidades.
|
String |
|
Método de distancia |
Especifica cómo se calculan las distancias desde cada entidad hasta las entidades vecinas.
|
String |
|
Estandarización |
Se recomienda la estandarización de filas siempre que la distribución de las entidades esté potencialmente influenciada debido al diseño de muestreo o a un esquema de agregación impuesto.
|
String |
|
Banda de distancia o Distancia de umbral (Opcional) |
Especifica una distancia de valor límite para las opciones de Distancia inversa y Distancia fija. Las entidades que están fuera del valor límite especificado para una entidad de destino se ignoran en el análisis de esa entidad. Sin embargo, para la Zona de indiferencia, la influencia de las entidades que están fuera de la distancia dada se reduce con la distancia, mientras que aquellas que están dentro del umbral de distancia se consideran por igual. El valor de distancia introducido debe coincidir con el del sistema de coordenadas de salida. En las conceptualizaciones de relaciones espaciales de la distancia inversa, un valor de 0 indica que no se aplica una distancia de umbral; cuando este parámetro se deja en blanco, se calcula y se aplica un valor de umbral predeterminado. Este valor predeterminado es la distancia euclidiana que garantiza que cada entidad tenga como mínimo un vecino. Este parámetro no tiene efecto cuando se seleccionan las conceptualizaciones espaciales Contigüidad de polígonos u Obtener ponderaciones espaciales a partir del archivo. |
Double |
|
Archivo de matriz de ponderaciones (Opcional) |
La ruta a un archivo que contenga los pesos que definen las relaciones espaciales, y potencialmente temporales entre las entidades. |
File |
|
Aplicar corrección False Discovery Rate (FDR) (Opcional) |
Especifica si la importancia estadística se evaluará con o sin la corrección FDR.
|
Boolean |
|
Número de permutaciones (Opcional) |
El número de permutaciones aleatorias para el cálculo de pseudo valores P. El número predeterminado de permutaciones es 499. Si elige 0 permutaciones, se calcula el valor P estándar.
|
Long |
|
Cantidad de vecinos (Opcional) |
El número de vecinos que se desea incluir en el análisis. |
Long |
Salida derivada
| Etiqueta | Explicación | Tipo de datos |
|---|---|---|
|
Nombre de campo de índice |
El nombre de campo de índice. |
Field |
|
Nombre de campo ZScore |
El nombre de campo de la puntuación z. |
Field |
|
Campo de probabilidad |
El nombre de campo de probabilidad. |
Field |
|
Tipo de clúster-valor atípico |
El nombre de campo de clúster/valor atípico. |
Field |
|
Id. de origen |
El nombre de campo de Id. de origen. |
Field |
Entornos
Espacio de trabajo actual, Espacio de trabajo temporal, Sistema de coordenadas de salida, Transformaciones geográficas, Mantener totalmente cualificados los nombres de los campos, La salida tiene valores Z, Valor Z de salida predeterminado, Resolución Z, Tolerancia Z, La salida tiene valores M, Resolución M, Tolerancia M, Resolución XY, Tolerancia XY, Generador de números aleatorios
Casos especiales
- Sistema de coordenadas de salida
-
Feature geometry is projected to the Output Coordinate System prior to analysis, so values entered for the Distance Band or Threshold Distance parameter should match those specified in the Output Coordinate System. All mathematical computations are based on the spatial reference of the Output Coordinate System. When the Output Coordinate System is based on degrees, minutes, and seconds, geodesic distances are estimated using chordal distances in meters.
- Generador de números aleatorios
-
The Random Generator Type used is always Mersenne Twister.
Información de licenciamiento
- Basic: Sí
- Standard: Sí
- Avanzado: Sí
Temas relacionados
- Vista general del conjunto de herramientas Asignación de clústeres
- Modelado de relaciones espaciales
- ¿Qué es una puntuación Z? ¿Qué es un valor p?
- Ponderaciones espaciales
- Autocorrelación espacial (I de Moran global)
- Análisis de punto caliente (Getis-ord Gi*)
- Cómo funciona el Análisis de clúster y de valor atípico (I Anselin local de Moran))
- Detección de valores atípicos espaciales
- Análisis de puntos calientes optimizado
- Autocorrelación espacial incremental
- Calcular banda de distancia a partir de recuento de vecindad
- Recopilar eventos
- Análisis optimizado de valores atípicos
- Buscar una herramienta de geoprocesamiento