Preparar datos para predicción (Herramientas de estadística espacial)
Resumen
Mejora los datos para flujos de trabajo predictivos en las herramientas de Clasificación y regresión basadas en bosques y aumentadas, Regresión lineal generalizada y Predicción de presencia única, así como en otros modelos. Esto implica dividir las entidades en conjuntos de entrenamiento y prueba, extraer variables de rásteres y entidades de distancia, equilibrar los datos para obtener una mayor precisión en la clasificación y realizar una simplificación espacial de los datos espaciales sesgados.
Más información sobre cómo funciona Preparar datos para predicción
Ilustración

Uso
Los datos de entrenamiento a los que se ha aplicado el equilibrio solo deben utilizarse para entrenar modelos predictivos. Los modelos no deben validarse con datos que hayan sido equilibrados para evitar sesgos de precisión y fugas de datos.
Se requiere una extensión de ArcGIS Spatial Analyst para usar rásteres como variables explicativas.
Si utiliza la clasificación para predecir eventos raros o categorías desequilibradas, utilice el parámetro Tipo de equilibrio para equilibrar el número de muestras dentro de cada nivel categórico. Los métodos de sobremuestreo aumentarán el número total de entidades y los métodos de submuestreo lo reducirán.
Cuando el parámetro Tipo de división se establece en División aleatoria o División espacial, las entidades de prueba de salida se pueden utilizar para evaluar la precisión del modelo con la herramienta Predecir utilizando el archivo de modelo de estadísticas espaciales Asegúrese de que la salida sea un archivo de modelo de estadísticas espaciales al ejecutar la herramienta de análisis elegida.
Cuando el parámetro Tipo de división se establece en División aleatoria o División espacial, la herramienta se asegurará de que todos los niveles categóricos tanto de la variable a predecir como de cualquier variable explicativa estén presentes en las entidades de entrenamiento de salida. No es necesario que todos los niveles categóricos estén presentes en el dataset de prueba.
Parámetros
| Etiqueta | Explicación | Tipo de datos |
|---|---|---|
|
Entidades de entrada |
Las entidades que se someterán a división, extracción y equilibrio. |
Feature Class |
|
Entidades de salida |
Las entidades de salida que se utilizarán como entidades de entrenamiento en una herramienta de modelo. |
Feature Class |
|
Tipo de división (Opcional) |
Especifica el método que se utilizará para dividir las entidades de entrada en subconjuntos de entrenamiento y prueba.
|
String |
|
Entidades del subconjunto de prueba de salida (Opcional) |
Un subconjunto del valor del parámetro Entidades de entrada que se puede utilizar como entidades de prueba. Este parámetro está disponible cuando el parámetro Tipo de división se establece en División aleatoria o División espacial. |
Feature Class |
|
Variable para predecir (Opcional) |
La variable del valor del parámetro Entidades de entrada que contiene los valores que se utilizarán para entrenar un modelo. Este campo contiene valores (de entrenamiento) conocidos de la variable que se usará para predecir en ubicaciones desconocidas. |
Field |
|
Tratar variable como variable de categorías (Opcional) |
Especifica si el valor del parámetro Variable para predecir se tratará como una variable de categorías.
|
Boolean |
|
Variables explicativas (Opcional) |
Una lista de campos que representan las variables explicativas que ayudarán a predecir el valor o la categoría del valor de parámetro Variable para predecir. Active la casilla de verificación De categorías en el caso de las variables que representen clases o categorías (por ejemplo, cobertura de suelo, presencia o ausencia). Columnas de la tabla de valores:
|
Value Table |
|
Entidades de distancia explicativas (Opcional) |
Las entidades de distancia de entrenamiento explicativas. Las variables explicativas se crearán automáticamente calculando la distancia entre las entidades proporcionadas y los valores del parámetro Entidades de entrada. Las distancias se calcularán desde cada una de las entidades del valor del parámetro Entidades de entrada hasta la entidad más cercana de este parámetro. Si el valor de este parámetro es polígonos o líneas, los atributos de distancia se calcularán como la distancia entre los segmentos más cercanos del par de entidades. |
Feature Layer |
|
Rásteres explicativos (Opcional) |
Las variables explicativas de entrenamiento extraídas de los rásteres. Las variables de entrenamiento explicativas se crearán automáticamente extrayendo valores de celda ráster. Para cada entidad del valor del parámetro Entidades de entrada, se extraerá el valor de la celda del ráster en esa ubicación exacta. Se utilizará remuestreo de ráster bilineal al extraer el valor de ráster en el caso de los rásteres continuos. La asignación de vecino más cercano se utilizará al extraer un valor de ráster desde rásteres de categorías. Active la casilla de verificación De categorías en el caso de los rásteres que representen clases o categorías tales como cobertura de suelo, presencia o ausencia. Columnas de la tabla de valores:
|
Value Table |
|
Convertir polígonos a resolución ráster para entrenamiento (Opcional) |
Especifica cómo se tratarán los polígonos si los valores del parámetro Entidades de entrada son polígonos con un valor categórico del parámetro Variable para predecir y solo se han proporcionado valores del parámetro Rásteres explicativas.
|
Boolean |
|
Porcentaje de datos como subconjunto de prueba (Opcional) |
El porcentaje de las entidades de entrada que se reservarán como dataset de prueba o validación. El valor predeterminado es 10. |
Double |
|
Tipo de equilibrio (Opcional) |
Especifica el método que se utilizará para equilibrar el valor del parámetro Variable para predecir desequilibrada o el sesgo espacial de las entidades de entrada. El método de equilibrio solo se aplica al valor del parámetro Entidad de salida.
|
String |
|
Distancia mínima al vecino más cercano (Opcional) |
La distancia mínima entre dos puntos cualesquiera o dos puntos cualesquiera de la misma categoría de valor del parámetro Variable para predecir cuando se aplica la simplificación espacial. |
Linear Unit |
|
Número de iteraciones para simplificación (Opcional) |
El número de iteraciones que se utilizarán para encontrar la solución óptima de simplificación espacial, manteniendo el mayor número posible de entidades y asegurando que no haya dos entidades dentro del valor del parámetro Distancia mínima al vecino más cercano especificado. El número mínimo de iteraciones es 1 y el máximo es 50. El valor predeterminado es 10. |
Long |
|
Codificar variables explicativas categóricas (Opcional) |
Especifica si se codificarán las variables explicativas categóricas.
|
Boolean |
|
Incorporar todos los campos de las entidades de entrada (Opcional) |
Especifica si todos los campos se copiarán de las entidades de entrada a las entidades de salida.
|
Boolean |
Entornos
Tamaño de celda, Sistema de coordenadas de salida, Generador de números aleatorios
Información de licenciamiento
- Basic: Limitado
Se requiere Spatial Analyst para utilizar rásteres. - Standard: Limitado
Se requiere Spatial Analyst para utilizar rásteres. - Avanzado: Limitado
Se requiere Spatial Analyst para utilizar rásteres.
Temas relacionados
- Vista general del conjunto de herramientas Modelado de relaciones espaciales
- Evaluar predicciones con validación cruzada
- Clasificación y regresión basadas en bosque y potenciadas
- Regresión lineal generalizada
- Predicción de solo presencia (MaxEnt)
- Cómo funciona Evaluar predicciones con validación cruzada
- Cómo funciona Preparar datos para predicción
- Buscar una herramienta de geoprocesamiento